Tuesday Index: Frontier AI at Work
Can models get through Tuesday? A composite score for frontier AI at work, built from the Surge benchmark suite.
Claude Fable 5
Adaptive/Max
GPT 5.6 Sol
Max
Claude Opus 5
Adaptive/Max
GPT 5.6 Sol
Medium
GPT 5.5
xHigh
Grok 4.6
xHigh
Claude Opus 5
Adaptive/High
GPT 5.5
Medium
Claude Opus 4.8
Adaptive/Max
DeepSeek V4 Pro
High
Grok 4.6
High
DeepSeek V4 Pro
Max
Qwen 3.8 Max
xHigh
Gemini 3.7 Flash
High
Gemini 3.7 Flash
Medium
GPT 5.4
xHigh
Kimi K3
Max
Gemini 3.5 Flash
High
Claude Opus 4.8
High
Grok 4.5
High
Claude Opus 4.7
Adaptive/Max
Gemini 3.5 Flash
Medium
Muse Spark 1.2
Auto
Gemini 3.1 Pro
High
Muse Spark 1.2
xHigh
Gemini 3.6 Flash
High
Muse Spark 1.1
xHigh
GLM 5.2
Auto
Claude Opus 4.7
High
Muse Spark 1.1
Medium
Qwen 3.7 Max
Thinking on
DeepSeek V4 Pro (preview)
High
Muse Glimmer 30B
xHigh
DeepSeek V4 Flash (preview)
High
Kimi K2.6
Thinking on
Inkling
xHigh
Claude Opus 4.6
High
Gemini 3.5 Flash-Lite
High
Claude Sonnet 4.6
High
Muse Glimmer 30B
High
Gemini 3 Flash
High
Qwen 3.5 Plus
Thinking on
Grok 4.3
High
Kimi K2.5
Thinking on
Grok 4.3
default
Gemini 3.5 Flash-Lite
Minimal
Mistral Large 3
default
Nova 2 Pro
default















