MODEL HISTORY
Grok 4.20 0309 v2 (Reasoning) 指标历史
Grok 4.20 0309 v2 (Reasoning) 的公开评测事实历史,共 17 条观测、14 项指标;只记录来源变化,不插值、不合成本站总分。
怎样理解这份历史
每条记录对应来源快照中的一个原始指标。相同值重复抓取不会制造新记录;只有数值、临时状态或移除状态发生变化时才追加。首个快照是本站的可追溯起点,不代表该指标第一次对外发布。
Index、Elo、百分比等单位不能互相相减,也不会在这里合成为“综合总分”。
APPEND-ONLY FACTS
观测记录
按观测时间倒序;同日多项指标分别保留。
| 观测日期 | 基准 / 版本 | 指标 | 原始值 | 状态 |
|---|---|---|---|---|
| Artificial Analysis model aggregatevpublic-model-v1 | 端到端响应时间seconds | 14.4 秒 | 有效 | |
| Artificial Analysis model aggregatevpublic-model-v1 | 生成速度tokens_per_second | 181.4 Token/s | 有效 | |
| Artificial Analysis model aggregatevpublic-model-v1 | 首个回答 Token 等待seconds | 11.7 秒 | 有效 | |
| Artificial Analysis model aggregatevpublic-model-v1 | 缓存读取价格 / 1M Tokenusd_per_1m_tokens | US$0.2 | 有效 | |
| Artificial Analysis model aggregatevpublic-model-v1 | 上下文窗口tokens | 2,000,000 | 有效 | |
| Artificial Analysis intelligence component evaluationsv4.1 | CritPtfraction | 6.6% | 有效 | |
| Artificial Analysis model aggregatevpublic-model-v1 | 端到端响应时间seconds | 13.9 秒 | 有效 | |
| Artificial Analysis intelligence component evaluationsv4.1 | GPQA Diamondfraction | 91.1% | 有效 | |
| Artificial Analysis intelligence component evaluationsv4.1 | Humanity's Last Examfraction | 32.2% | 有效 | |
| Artificial Analysis model aggregatevpublic-model-v1 | 输入价格 / 1M Tokenusd_per_1m_tokens | US$2 | 有效 | |
| Artificial Analysis capability indicesvpublic-model-v1 | Intelligence Indexindex | 37.0 | 临时 / 估算 | |
| Artificial Analysis intelligence component evaluationsv4.1 | AA-LCRfraction | 58.0% | 有效 | |
| Artificial Analysis intelligence component evaluationsv4.1 | AA-Omniscienceindex | 15.3 | 有效 | |
| Artificial Analysis model aggregatevpublic-model-v1 | 输出价格 / 1M Tokenusd_per_1m_tokens | US$6 | 有效 | |
| Artificial Analysis model aggregatevpublic-model-v1 | 生成速度tokens_per_second | 195.5 Token/s | 有效 | |
| Artificial Analysis intelligence component evaluationsv4.1 | SciCodefraction | 45.6% | 有效 | |
| Artificial Analysis model aggregatevpublic-model-v1 | 首个回答 Token 等待seconds | 11.3 秒 | 有效 |