Gemini 3.6 Flash: zo lees je de launch-benchmarks

Close-up van handen op een mechanisch toetsenbord met wazig kleurig scherm

Google presenteerde vandaag Gemini 3.6 Flash met de claim dat het “prior generations” overtreft op agentic benchmarks. Dat klopt. Het is ook precies het soort zin waar je doorheen moet prikken: beter dan je eigen vorige model is een lage lat. De interessantere vraag is wat de launch-tabel wel en niet bewijst — en dat maakt deze release een mooie oefening in benchmarks lezen.

Het model is per direct beschikbaar in AI Studio en de Gemini API. De launch-video hieronder is trouwens zelf al een leesoefening: let op de disclaimer onderin beeld, “sequences shortened and screen images simulated”.

Googles launch-video bij Gemini 3.6 Flash (bron: Google)

Wat Google rapporteert

De feiten uit de release: $1,50 per miljoen invoertokens, $7,50 uitvoer (was $9,00 bij 3.5 Flash). Het model wint van zijn voorganger op elke gepubliceerde benchmark en van het oudere topmodel 3.1 Pro. Tegen de concurrentie wint het op drie fronten: computerbediening (OSWorld-Verified 83,0 procent), grafiek-redenering (CharXiv 85,2 procent) en lange context (GDM-MRCR 91,8 procent op 128k). Het verliest op coding: DeepSWE 49 procent tegen 67 voor GPT-5.6 Luna, SWE-Bench Pro 58,7 tegen 64,7 voor Grok 4.5.

Leestechniek 1: kijk wie er in de kolommen staat

Googles eigen vergelijkingstabel zet 3.6 Flash naast twee oudere Gemini’s, GPT-5.6 Luna, Grok 4.5 en Claude Sonnet 5. Drie van de zes kolommen zijn dus eigen modellen. De staafdiagrammen in de aankondiging vergelijken zelfs uitsluitend met eigen voorgangers: 3.1 Pro, 3.5 Flash, 3.6 Flash, netjes oplopend. Dat levert altijd een stijgende lijn op. Wil je weten of een model goed is, negeer dan elke grafiek waar alleen de eigen familie in staat.

Leestechniek 2: let op de lege cellen

In de tabel staan streepjes bij Grok 4.5 op OSWorld en bij Luna en Grok op CharXiv-met-tools en de 1M-contexttest. Een streepje betekent: niet gerapporteerd, niet per se niet gemeten. Gemini “wint” de 1M-langecontexttest met 54,0 procent — maar het is het enige model met een cijfer in die rij. Dat kan betekenen dat de rest het niet kan, of dat de rest het niet publiceert. Uit deze tabel kun je dat niet weten, en dat is precies waarom die rij er zo staat.

Leestechniek 3: tokenverbruik is de verborgen prijs

Het sterkste cijfer uit de release is geen benchmarkscore. Op DeepSWE daalde het gemiddelde uitvoerverbruik van 276.000 tokens per taak (3.5 Flash) naar 97.000 (3.6 Flash), bij een hógere score. Voor wie agents bouwt is dat driedubbel winst: lagere kosten, snellere runs en minder context die volloopt met eigen gepraat. Vergelijk modellen dus altijd op prijs per afgeronde taak, niet op prijs per token. Per token is GPT-5.6 Luna ($6,00 uitvoer) namelijk goedkoper dan deze Gemini ($7,50) — en op coding ook nog beter.

Leestechniek 4: benchmarks zelf zijn ook maar software

SWE-Bench Pro duikt weer in elke kolom op, terwijl OpenAI eerder dit jaar liet zien dat een fors deel van de taken in dat soort codebenchmarks kapot of dubbelzinnig is. Een verschil van een paar procentpunten tussen modellen valt makkelijk binnen die ruis. Behandel scores die minder dan vijf punten uit elkaar liggen als gelijkspel, en beslis op eigen tests.

Wat blijft er dan over?

Na aftrek van de marketing blijft dit staan: 3.6 Flash is een reële verbetering binnen Googles middenklasse, met drie aantoonbare sterktes (computer use, grafieken, lange context) en één duidelijke zwakte (coding, waar Luna, Grok en Sonnet 5 allemaal hoger scoren). De prijsverlaging plus het lagere tokenverbruik maakt het voor agent-werk het proberen waard.

Praktisch: draai je eigen eval-set. Tien taken uit je echte workflow, blind beoordeeld, kosten per taak ernaast. Hoe je zo’n vergelijking opzet zonder dure tooling beschreven we in prompttesten zonder dure tools, en welk OpenAI-model je als referentie pakt staat in de GPT-5.6 modelkeuzegids. Launch-tabellen zijn het begin van je onderzoek, nooit het einde.