
11月27日晚,DeepSeek悄悄地在Hugging Face 上开源了一个新模型:DeepSeek-Math-V2。这是一个数学方面的模型,也是目前行业首个达到IMO(国际奥林匹克数学竞赛)金牌水平且开源的模型。
手机号码:13302071130在同步发布的技术论文中,DeepSeek表示,Math-V2的部分性能优于谷歌旗下的Gemini DeepThink,并展示了模型在IMO-ProofBench基准以及近期数学竞赛上的表现。
具体来看,在其中的Basic基准上,DeepSeek-Math-V2 远胜其他模型,达到了近99%的高分,而排在第二的谷歌旗下Gemini Deep Think (IMO Gold)分数为89%。但在更难的 Advanced 子集上,Math-V2分数为61.9%,略逊于 Gemini Deep Think (IMO Gold)的65.7%。
在这篇名为《DeepSeek Math-V2:迈向可自验证的数学推理》的论文中,DeepSeek指出,大语言模型已经在数学推理方面取得了重大进展,这是人工智能的重要试验台,如果进一步推进,可能会对科学研究产生影响。
ChatGPT横空出世后即风靡全球,它以强大的信息整合和对话能力惊艳了整个世界,随着技术的不断更迭,目前最新版的ChatGPT已经拥有撰写论文、代码、软件,以及进行科研辅助分析等多种强大功能。
姬女士说:“他们推销的销售员也没告诉我,我们现在三四百户人都存在公摊面积大,大家都不知道。”
但当前的AI在数学推理方面有着研究局限:以正确的最终答案作为奖励,正确的答案却不能保证正确的推理。许多数学任务,如定理证明,需要严格的分步推导,而不是数字答案,这使得最终答案奖励不适用。
为了突破深度推理的极限,DeepSeek认为有必要验证数学推理的全面性和严谨性。团队提出,自我验证对于扩展测试时间计算尤为重要,特别是对于那些没有已知解决方案的开放问题。
此次DeepSeek推出的Math-V2就从结果导向转向了过程导向,展示了强大的定理证明能力。这一模型不依赖大量的数学题答案数据,而是通过教会AI如何像数学家一样严谨地审查证明过程,预应力钢绞线从而在没有人类干预的情况下,也能不断提升解决高难度数学证明题的能力 。
论文提到,Math-V2在IMO 2025和CMO 2024上取得了金牌级成绩,在Putnam 2024上通过扩展测试计算实现了接近满分的成绩(118/120)。
DeepSeek认为,虽然仍有许多工作要做,但这些结果表明,可自我验证的数学推理是一个可行的研究方向,可能有助于开发更强大的数学AI系统。
对于DeepSeek此次的动作,海外的反应是“鲸鱼终于回来了”。有网友感慨,DeepSeek以10个百分点的优势击败了谷歌的IMO Gold 获奖模型DeepThink,这不在预测范围内。“想象一下,当他们公布编程模型时会发生什么,我打赌他们绝对有编程模型。”
目前,行业头部厂商的模型已经又迭代了一轮,11月,先是OpenAI发布了GPT-5.1,几天后xAI发布Grok 4.1,就在上周谷歌发布了Gemini 3系列引爆AI圈,“也该轮到DeepSeek出牌了”。不过,更受外界关注的仍然是,DeepSeek的旗舰模型到底什么时候更新,行业期待“鲸鱼”的下一个动作。
举报 第一财经广告合作,请点击这里此内容为第一财经原创,著作权归第一财经所有。未经第一财经书面授权,不得以任何方式加以使用,包括转载、摘编、复制或建立镜像。第一财经保留追究侵权者法律责任的权利。如需获得授权请联系第一财经版权部:banquan@yicai.com 文章作者刘晓洁
相关阅读 AI进化速递丨DeepSeek提出mHC新架构DeepSeek发布新论文,提出mHC(流形约束超连接)新架构。
123 01-01 20:20 2025:25个关键词里的中国与世界回看2025年,一财记者用25个关键词总结中国和世界。
260 2025-12-30 21:20 AI被灌入垃圾营销信息:榜单排名成重灾区,低至几千元可改变AI回答业内人士称,AI需要建立一套可交叉验证的信源体系,使引用的内容经得起反复核对。
311 2025-12-17 16:26 102分!AI首战中学奥赛拿下金牌,离超越人类已经不远?“AI在奥赛中超越人类是未来一定会发生的事。”
9 344 2025-12-12 20:38 AI进化速递 | DeepSeek发布新模型DeepSeek V3.2正式版发布;豆包手机助手发布技术预览版三明预应力钢绞线厂。
85 2025-12-01 20:44 一财最热 点击关闭