OpenAI en Anthropic lanceerden deze week op dezelfde dag allebei een AI die je werk niet beantwoordt maar uitvoert. Op donderdag 9 juli zette OpenAI ChatGPT Work live, een agent die zelf documenten, spreadsheets, presentaties en hele websites maakt, informatie opzoekt en meerstaps klussen afmaakt. Anthropic bracht diezelfde dag Claude Cowork naar web en mobiel, de agent die het in januari als desktopversie startte. En OpenAI zette GPT-5.6 in drie varianten, Sol, Terra en Luna, algemeen beschikbaar in ChatGPT, Codex en de API.
Van antwoord naar uitvoering
Dit is een andere beweging dan een nieuw, iets slimmer model. Een chatbot geeft je een antwoord. Een agent levert een afgemaakt product. ChatGPT Work verzamelt context uit je apps en bestanden, bouwt de slides of de sheet, blijft aan een langere klus werken en vraagt onderweg je goedkeuring voor belangrijke stappen. Je kunt taken inplannen die één keer draaien, zich herhalen of op een trigger reageren. Het draait in ChatGPT en in Slack, eerst voor Pro-, Enterprise- en Edu-gebruikers, daarna voor Plus en Business.
De modelrace loopt daar gewoon onder door. GPT-5.6 Sol scoorde 88,8 procent op Terminal-Bench 2.1, een test voor zelfstandig programmeren, net boven het sterkste Claude-model en GPT-5.5 (beide 88,0). Prijzen per miljoen tokens: Sol 5 dollar in en 30 uit, Terra 2,50 en 15, Luna 1 en 6. De kleinste is goedkoop, maar zakt op langere, complexe taken flink weg.
De vraag is niet welk model, maar welke taak
Hier zit de valkuil. De verleiding is om te vergelijken welk model het hoogst scoort. Voor jouw bedrijf is dat de verkeerde vraag. De echte verschuiving is dat je een taak kunt overdragen in plaats van een vraag stellen.
Neem een installatiebedrijf in Apeldoorn met veertien monteurs. Een offerte opstellen uit een mailtje, de urenstaat en de prijslijst was tot voor kort handwerk. Een agent die die bronnen leest en een concept-offerte aflevert, scheelt de binnendienst een halve dag per week. Dat is tijdwinst die je kunt nazien, geen demo. Maar een agent die zelf uitvoert, kan ook zelf de fout in gaan. Daarom is de goedkeuringsstap die beide tools inbouwen geen bijzaak, maar het hele punt.
Begin met één taak en één goedkeuringspunt
Kies deze week één terugkerende klus die veel tekst inleest en een vast document oplevert. Een offerte, een weekrapportage, een vergaderverslag. Laat de agent het concept maken, maar zet een mens op de laatste knop voordat er iets de deur uit gaat. Test het twee weken op echt werk, niet op een voorbeeld. Kies bewust je model: de dure variant voor werk waar oordeel en lange context tellen, de goedkope voor bulk. En vraag je softwareleverancier waar je data heen gaat zodra de agent je apps inleest.
De tools stopten deze week met antwoorden en begonnen met afmaken. Het bedrijf dat als eerste leert waar het de knop loslaat en waar niet, wint geen demo maar een werkweek.
Bronnen
Previewing GPT-5.6 Sol, OpenAI. Algemene beschikbaarheid op 9 juli 2026 en de drie varianten via Simon Willison en Artificial Analysis, 9 juli 2026.
Prijzen per miljoen tokens en de Terminal-Bench 2.1-score via Vellum en Finout, juli 2026.
ChatGPT Work en de vergelijking met Claude Cowork via CGTN, 10 juli 2026, en Nerova.



