Model Cards / Google DeepMind

Gemini 3.5 Flash Model Card

model card1,177 words·5 min read·Jun 28, 2026·Source
Chaptered summary is still being generated for this document. Showing a heuristic brief in the meantime.
Summary
1,177-word document condensed to 52 words. Google DeepMind · Jun 28, 2026
TL;DR

Gemini 3.5 Flash - Model Card Model Cards are intended to provide essential information on Gemini models, including known limitations,

Top benchmarks
BenchmarkVariantScore
GDPval-AAeconomically valuable knowledge work1656.00
CharXiv Reasoningno tools84.2%
MCP Atlasmulti-step MCP workflows83.6%
MMMU-Prono tools83.6%
OSWorld-Verifiedagentic computer use78.4%
MRCR v2 (8-needle)128k average77.3%
Terminal-bench 2.1Terminus-2 harness76.2%
ARC-AGI-2abstract reasoning72.1%

Showing top 8 of 21. See full list below.

Every italicized passage is a verbatim substring of the source document (checked deterministically after extraction). Field selection is heuristic — some quotes may lack surrounding context and some claims may be absent if no matching pattern appeared. For citation, open the source: original model card · source SHA 81284c1840d5 · version dated Jun 28, 2026.

Extracted Evaluations(21 results)

Sort by:0/21 rows fully reproducible (0%)
BenchmarkCategoryStateScoreSetupSource
agentscored
78.4
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
multimodalscored
83.6
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
otherscored
1656.0
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
otherscored
84.2
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
otherscored
83.6
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
MRCR v2 (8-needle)
otherscored
77.3
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
Terminal-bench 2.1
otherscored
76.2
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
Finance Agent v2
otherscored
57.9
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
Toolathon
otherscored
56.5
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
otherscored
53.9
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
otherscored
40.2
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
Blueprint-Bench 2
otherscored
33.6
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
otherscored
8.9
accuracy
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
/ non-egregious
otherscored
0.8
accuracy
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
otherscored
0.0
accuracy
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
otherscored
-2.6
accuracy
Averagemissing: shot countmissing: methodmissing: training state
self-reported
otherscored
-3.9
accuracy
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
Frontier Safety Assessment/ cyber
othermentioned
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
Child Safety
othermentioned
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
Frontier Safety Assessment
othermentioned
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported
reasoningscored
72.1
missing: shot countmissing: methodmissing: languagemissing: training state
self-reported