2020
2021
2022
2023
2024
2025
2026
4 sec
36 sec
6 min
1 hour
10 hours
Task duration (for humans)
where logistic regression of our data
predicts the AI has
a 50%
chance of succeeding
LLM release date
Train adversarially robust image model
Train classifier
Find fact on web
Count words in passage
Answer question
GPT-2
GPT-3
GPT-3.5
GPT-4
GPT-4 Nov '23
Claude 3 Opus
GPT-4 Turbo
GPT-4o
Claude 3.5 Sonnet (Old)
o1-preview
Claude 3.5 Sonnet (New)
o1
Claude 3.7 Sonnet
o3
Claude Opus 4
Claude Opus 4.1
GPT-5
Gemini 3 Pro
GPT-5.1-Codex-Max
Claude Opus 4.5
GPT-5.2
(high)
Time horizon of software tasks
different LLMs can complete
50%
of the time
Source:
METR Time Horizons
· Analysis code on
Github
· Raw data
here