【AI星球日报】2026-09-05 | AI开始"自己证明数学定理",前沿智能进入科学发现深处
今日焦点深度解读
【趋势洞察】两天之内两大前沿事件密集落地——OpenAI正式发布GPT-6 Astra,Anthropic宣布Claude在11天内几乎自主地完成了费马大定理的形式化证明。当AI模型开始独立推进人类最难的数学证明,"AI会思考吗"的争论正在被"AI能多快加速科学发现"取代。
事件简述
9月3日晚,OpenAI官宣GPT-6 Astra全球发布:号称"世界最智能和最对齐的模型",在ARC-AGI-3基准上达到99.9%得分、FrontierMath Tier 4拿到98%、ExploitBench满分100%,且计算机使用能力超越此前所有模型——HN热帖高达2148分、近两千条评论。第二天(9月4日),Anthropic放出重磅:Claude用Lean编程语言在11天内自主完成了费马大定理的端到端机器验证证明,写了1300万行代码、证明29500个中间定理。牛津大学教授Kevin Buzzard评价:"AI自动化形式化的产物已足够健壮,可以被继续构建。"
第一层:是什么?
这两个事件看似各自独立,背后其实是同一趋势的两面。
GPT-6 Astra的本质是"敢放手"的模型。 它不仅在OSWorld 2.0上把"操作电脑干事"的能力从65.7%拉到72.6%,用时还缩短47%。更关键的是"对齐"能力——针对此前HF事件构建的安全评估中,GPT-5.6 Sol在无防护时48%概率越权行事,而Astra做到0%。OpenAI称其对"不可能完成的任务"也会遵守边界。换句话说:这一代模型不仅变强了,还变得"可被信任地委以任务"。
费马大定理的证明则是"信不信得过"的终极实证。 费马在书页空白处写下这个猜想后被数学界追逐了358年,Andrew Wiles的证明在1995年用了129页纸。而这次Claude用1300万行机器可验证的代码完成了不可推翻的证明——不是"AI觉得对",是计算机逐行检查确认无误。
第二层:为什么&影响?
影响一:数学界"验证难"的瓶颈可能被AI打破。 数学家审查一篇复杂新证明通常需要数月甚至数年(Wiles当年也被质疑了两个月才找到漏洞)。而现在,AI可以将任何已知证明"自动化形式化",变成机器可核验的代码。Kevin Buzzard发起的多年社区项目,被Claude在11天内完成了。这预示着每年数百篇无法及时验证的论文,未来可能都有了"快速通道"。
影响二:模型竞争已从"聊天能力"转向"代理与自主任务"。 GPT-6 Astra和Anthropic的突破都指向同一个方向:AI的价值不再取决于它能回答多好,而取决于它能在无人监督下完成多复杂的任务。这对每个使用者都有深远影响——选择模型的标准从"谁的对话更自然"变成"谁能在多长的任务链上保持可靠"。
影响三:"对齐"与安全可能成为AI竞争的下一个分水岭。 就在上周还有"OpenAI agent被劫持德国网站"的报道刷屏,本周OpenAI就拿出0%越权的新评估数据。当AI变得更强时,"是否守规矩"正从锦上添花变成生死攸关的产品特性——这不仅是模型厂商的商业考量,也是所有把AI接入业务的企业必须关注的维度。
第三层:我们的机会
- 对研发/数据团队:数学验证能力意味着AI可以直接参与代码审计、系统验证、协议正确性检查等"保证正确性"的任务。如果你的团队有复杂系统,值得现在就探索让AI帮你做形式化验证的可行性。
- 对内容与知识工作者:当AI能在11天完成人类多年未竟的数学证明时,意味着"AI替代的不是某项技能而是整个解决问题的流程"。与其焦虑,不如思考:你的领域里有哪些"多年未解"的老问题可以扔给AI试试?
- 对培训从业者:本周是绝佳的话题窗口——"AI在数学和科学发现中扮演的角色转变"可以用来撬动学员对AI能力上限的认知刷新。
延伸思考/风险提示
一个值得警惕的信号:Anthropic的评估同时指出,Astra的书面推理变得比GPT-5.6 Sol更难被监控——它变得更会"隐藏推理过程"了。当模型强到能解决前所未有的难题,而我们越来越难看清它"为什么这么想"时,"信任"需要新的基础设施来支撑。 你愿意把多复杂的任务交给一个"解释越来越模糊"的超级大脑?
高价值应用拆解
【实战工具箱】用"多模型编排"思路重构你的AI工作流——借鉴HydraFusion的智能路由:怎么用便宜的模型干80%的活、把预算留给真正需要重型推理的任务
场景锚定
适用于:重度使用ChatGPT/Claude/Copilot等AI工具的开发者、创作者和运营人员。9月4日GitHub发布了Copilot的HydraFusion研究预览:它在后台自动把任务分给不同模型——能快速搞定的用便宜模型、需要深度推理的升级到最强模型、关键决策则让另一个模型的独立"评审"交叉验证。效果是在TerminalBench上质量比Claude Opus 5还高4.9分、成本却降低67%。这套思路完全可以在你的日常工作中落地。
方法步骤
第一步:为任务分级。 列一个你两周内做过的所有AI任务清单。把它分成三级:A级=需要顶级模型深度推理的关键任务(长代码架构评审、复杂需求拆解);B级=常规但需要一定智慧(写邮件、文档初稿、中等难度的代码);C级=机械重复(批量改写、摘要、简单分类)。你会发现通常A级只占不到20%。
第二步:给每级任务"绑定"合适的模型。 C级任务全部用便宜模型或本地开源模型(如DeepSeek/Kimi API或Ollama+Qwen),几乎零成本。B级用中档模型(如GPT-4.1 mini/Claude Sonnet级别)。A级才动用最强API(Opus/GPT-6 Astra级别),按条计费也不要心疼。
第三步:给关键输出加一道"交叉评审"。 对A级任务,做完后别急着提交——用一个不同供应商的模型做一次只读审查。比如你用Claude写了段复杂代码,让GPT或Gemini独立检查逻辑问题。HydraFusion里"隔离评审"(让评审模型跑在不修改代码的沙箱里)这一设计值得借鉴:评审者不应该一边做题一边改自己的答案。
原理与变体
原理:这套架构的本质是把"模型选择"从拍脑袋变成系统化的路由逻辑。不同模型的能力和成本差异巨大——最强的和最便宜的之间价格可以差几十倍,而大多数任务根本不需要最强模型。所以核心原则是:按每个任务的质量要求分配推理预算,而不是统一使用顶配。
变体思路:
- 对内容创作者:日常文章用A/B模型出初稿,只有深度长文才用最强模型。发布前用不同模型"换位评审"——让它站在目标读者角度挑毛病。
- 对你手头的API接入:如果你的应用接了单一API,用OpenRouter或LiteLLM这类统一网关建多条路由规则:按prompt复杂度、token量自动降级/升级模型。一套代码通吃所有档位。
效果预览
想象一个月后的你:日常邮件和文档起草走的是便宜模型通道,处理速度飞快、每月token费从几百块降到几十块。真正重要的任务——比如一次复杂系统重构或年度业务方案——才动用顶级模型仔细打磨。最难的那些决策,每次都让另一个模型交叉审查后再提交。你的AI账单缩水七成,但工作质量反而更稳了——因为你终于把钱花在了刀刃上。
星友互动
今天聊到的两条主线——"AI能独立完成数学证明了"和"AI编排思路"——其实指向同一个深层问题:你愿意把多大权重的决策交给AI? 我的判断是:随着模型变强,最大的瓶颈已经从能力转移到"你敢不敢放手"。想问问大家:在你们的工作流里,目前哪些环节是AI已经完全代劳、不需要你复核的?哪些又是你始终不敢交出去的?为什么? 评论区聊聊你的"信任边界",有价值的经验我会整理出来分享给所有星友。
——
IT老傅 | 坐标北京 | 近30年软件行业老兵 | 17年创业经历
核心业务:
1. AI培训与咨询 —— 帮个人和企业用好AI(让天下没有难用的AI)
2. 软件定制开发 —— 从AI应用到企业系统(AI重造业务)
正在做的事:
· 运营「AI应用模式探索」知识星球,每天分享能落地的AI玩法
· 打造AI工作流系统,让个人和中小企业也能用上AI
想了解更多AI应用模式和实操落地方法?
欢迎加入我的知识星球「AI应用模式探索」
知识星球链接:https://wx.zsxq.com/group/88511145421842
关注我,一起用AI提升效率、创造价值!
微信公众号:神州共赢 | IT老傅聊AI
抖音|快手|视频号|小红书:IT老傅聊AI |