AI统治2026 IMO国际奥数竞赛:Claude Fable 5、GPT-5.6 Sol、Kimi K3 均获得满分

2026 年国际数学奥林匹克竞赛(IMO)刚刚落下帷幕,但这届比赛注定会被载入史册。在这次被称为“高中生数学天花板”的博弈中,Claude Fable 5、GPT-5.6 Sol、Kimi K3 以及 Axiom Math 四大模型全部斩获了 42/42 的满分成绩。这标志着 AI 在逻辑推理领域的边界已经彻底跨越了 IMO 级别,将曾经的智力高峰夷为平地。

群雄逐鹿:谁是真正的“数理之王”?​

虽然四款模型都拿到了满分,但通过对比解题过程的数据,我们可以清晰地看到不同 AI 的“性格”差异:

Claude Fable 5:极致效率的“全能学霸”​

Claude 表现出了令人惊叹的稳定性。它不仅以 2.5 小时的总用时位居榜首(远低于人类 9 小时的限制),而且 6 道题全部“一发入魂”(1 attempt)。这种“快、准、狠”的表现,证明了其在复杂逻辑链条上的极高容错率。

GPT-5.6 Sol:精打细算的“性价比之神”​

如果说 Claude 赢在速度,那 GPT 则赢在了成本。尽管在 P2 题上经历了第二次尝试才成功,但它的核心成本(Clean Cost)仅为 9.74 美元左右。在保证满分的前提下,GPT 展现了极高的算力利用率。

Kimi K3:力大砖飞的“算力狂魔”​

Kimi 的满分之路显得最为“坎坷”。为了攻克最难的 P3,它尝试了 4 次,甚至一度触碰到了 150 分钟的单题时长上限。其输出 Token 量达到了惊人的 154 万,几乎是其他选手的数倍。这种“大力出奇迹”的风格,反映了其在面对极端难题时更倾向于通过海量搜索和验证来换取正确性。

Axiom Math:严谨至上的“逻辑大师”​

最令学术界振奋的是 Axiom Math,它不仅给出了答案,还直接在 Lean(一种形式化数学证明语言)中完成了全部证明。这意味着它的每一步推导都经过了计算机逻辑的严密验证,彻底杜绝了 AI 常见的“幻觉”问题。

AI 统治 IMO 2026:Claude Fable 5、GPT-5.6 Sol、Kimi K3 均获得满分

地狱难度的 P3 与 P6:AI 也要“掉头发”​

从尝试次数和 Token 消耗量来看,P3 和 P6 依然是本次竞赛的“大魔王”。即便强如 Kimi,在 P3 面前也显得有些吃力。数据显示,P3 的平均消耗 Token 远超其他题目,这说明即便是对于当前的顶尖 AI 而言,深度数论或组合数学中的极端逻辑链条依然是极具挑战的领域。

总结:数学竞赛的奇点时刻

当 Claude 和 GPT 在不到 4 小时内就完成了人类精英需要 9 小时才能挑战的任务时,我们不得不承认,数学竞赛的传统意义正在被重构。AI 的前沿已经正式超越了 IMO 级别的数学难题,这不仅是算法的胜利,更是人类通往通用人工智能(AGI)道路上的又一个里程碑。