ASTRA · AI × MATHEMATICSai-math / 研究

已验证 · 2026/08/05

论文分享 #1|Astra 的十项数学结果:答案、正确性与理解开始脱钩

Astra 公布十项长期开放问题的新结果。本文沿着“答案、正确性与理解开始脱钩”这条主轴,解释这些题为何难、模型怎样跨过旧方法的障碍、人类为同等级问题付出了多少历史努力,以及证明供给增加后真正稀缺的东西。

类型
研究
项目
ai-math
阅读
10 分钟
字数
4854

1. 十项结果,究竟发生了什么

2026 年 8 月 1 日,OpenAI 发布 Ten advances in mathematics and theoretical computer science,公布了下一代模型家族 Astra 的一个内部版本取得的十项数学与理论计算机科学结果。

事情可以压缩成一句话:模型生成数学论证,人类用同一模型把论证整理成 249 页论文,随后模型又把每项论证形式化成 Lean 证书。 OpenAI 同时公开了论文集、发现过程回顾和形式化代码。

关键信息准确口径
十项结果都针对长期开放问题;有的解决或反驳命名猜想,有的推进长期未动的界
覆盖范围高维几何、编码理论、群论、算子代数、算术电路、量子复杂性、格问题、极值组合
约 2,000 美元只指找到这十个解法所需 token 按 Sol API 费率估算的价格
公开材料249 页论文集、62 页发现过程回顾、Lean 4 仓库

这不是十道竞赛题,也不是十道分量相同的“世纪难题”。更准确的定级是:同一个通用模型,在八个专业方向上,连续产出十项足以进入研究论文和同行审查流程的新结果。 其中包括首个显式非 sofic 群、对 Connes 刚性猜想的反驳、一般双人纠缠博弈的指数并行重复定理,以及对高维球堆积、格近似困难性和 Ramsey 数等问题的推进。

Astra 十项结果所属领域、核心困难与结果类型
Astra 十项结果所属领域、核心困难与结果类型

图里最值得看的不是“十”这个数字,而是中间一列:这些问题卡住的原因彼此并不相同。一个模型如果只擅长某类符号技巧,很难同时跨过几何中的尖锐常数、群论中的有限近似、量子信息中的不对易,以及复杂性理论中的下界障碍。

2. 这些题为什么难推

研究级难题的难,通常不在于公式特别长,而在于:一个领域里最自然、最成熟的办法已经被很多人推到了极限。 继续多算十页往往没有用,必须先看出旧方法到底丢了什么,再换一套能保住关键信息的语言。

三个例子足以说明这种难度。

球堆积的改进看似只是指数里一个小数的变化。 但密度上界形如 2^{-αd},指数 α 的微小提升会随维度 d 被指数放大。一般高维情形的关键指数自 1978 年后长期没有改进,不是因为没人继续算,而是全局估计会抹掉误差出现的位置;看不见“坏质量”集中在哪里,就无法再把界推紧。

量子博弈不能把一次证明简单复制很多遍。 题目虽然独立发放,玩家却能用跨副本的联合量子测量制造相关性。经典概率里直觉上应当相乘的成功率,在量子世界里并不会自动相乘。此前一般情形只能得到多项式衰减,缺的是一种既重新组织量子态、又不破坏真实测量概率的办法。

非 sofic 群不是“多试几个有限模型”就能找到。 要做的不只是构造一个奇怪的群,而是证明:无论拿多大的有限置换系统去逼近,总会有一部分乘法关系无法同时成立。也就是说,它要求对无穷多类有限近似做一次统一否定。

如果换成人类,尺度是多少

最诚实的比较不是编一个“人类总价”,也不是把问题寿命直接当成人年。公开资料没有告诉我们,人类独立完成十项结果需要多少位数学家、多少工时。可以核验的是:这些问题或它们此前的最佳通用基准,在数学共同体面前停留了多久。

六个代表问题从公开提出或长期基准到 2026 年经历了 22 至 62 年
六个代表问题从公开提出或长期基准到 2026 年经历了 22 至 62 年

六条代表性问题线横跨 22–62 个自然年。这个数字不代表有人连续工作了 62 年;它代表多代研究者留下的定义、失败路线、局部定理、技术语言和判断标准,直到 2026 年仍没有被完整跨过。

努力层人类共同体提供了什么Astra 此次披露了什么
问题史22–62 年的公开问题、文献、定义与前置定理直接继承这些成熟的问题表述和知识基础
候选解法搜索没有可核验的统一人月或总价找到十个解法所需 token 约 2,000 美元
论文与验证专家组织论证、核对归因、审稿、讲解与后续使用人类借助同一模型准备论文;模型生成 Lean 证书
共同体吸收通常以月、年乃至一代人的时间完成截至 8 月 5 日仍在起步

所以,2,000 美元不是建造整座数学大厦的价格。它更像是:在人类用几十年修好的大厦里,寻找十条新通道的边际搜索费。 真正惊人的地方,是前沿探索的边际成本突然下降,而不是此前的人类投入失去了价值。

3. Astra 是怎样跨过旧路线的

OpenAI 另外发布的 How the Ideas Came Together 不是逐 token 的原始思维记录,而是一个模型阅读原始推理轨迹和最终论文后写成的回顾。它能帮助我们看见成功路线的结构,却不能回答总共尝试了多少候选、失败了多少次、每一步有多少人工提示。

在这个边界内,四个案例呈现出很一致的解题动作。

球堆积:从“误差有多少”改问“误差在哪里”。 原来的全局范数把符号和位置压成一个总量。新路线直接追踪局部负质量,再用 Mellin 变换重写径向 Fourier 问题。通俗地说,它没有继续拧紧旧估计,而是把被旧估计抹掉的位置信息重新找了回来。

非 sofic 群:造一个让错误无处可逃的结构。 早期构造的共同漏洞,是有限近似中的缺陷可以在不同层之间逃走。新路线转向自相似的二元 Leavitt 代数,把乘法、性质 (T) 的刚性和自压缩放进同一结构,最终迫使任何有限近似同时满足互相冲突的要求。

量子并行重复:换表示,但守住 Born 权重。 朴素纯化会被不对易和小特征值放大误差。探索先看清一个原则:可以摊平麻烦的谱尺度,却不能改变测量概率依赖的权重。最终论文用有限的 resolvent 纯化把这个原则压成可证明的工具,再接上鞅与抽样论证。

Ehrhart 猜想:保留证明骨架,换掉几何外壳。 一条很长的调和分析路线能得到漂亮的中间结论,却始终拿不到猜想要求的尖锐阶乘常数。模型没有继续修补常数,而是用 Monge–Ampère 方程把凸体改写成环面几何中的势函数;有用的过滤结构被保留,限制它的几何语言被替换。

四个代表性结果都通过定位旧路线的信息损失、切换数学表示并保留关键不变量而取得突破
四个代表性结果都通过定位旧路线的信息损失、切换数学表示并保留关键不变量而取得突破

这比“模型搜索了更大的证明空间”更准确。四条路线都经历了同一件事:先诊断旧方法的信息损失,再改变表示,守住一个关键不变量,最后把新视角压成定量不等式、显式构造或矛盾。研究级能力的信号,不是一次猜中,而是在旧路失败后知道该换哪一种数学语言。

当然,这个判断来自 OpenAI 公布的回顾材料,而不是一次完全受控、可复现的能力实验。它说明十项成功案例有什么共同结构,不说明随机给 Astra 一道同等级开放问题就有多大成功率。

4. 真正的断点:答案、正确性与理解开始脱钩

走到这里,才适合讨论 Astra 的意义。

过去,一位数学家找到证明时,通常也在过程中完成了相当一部分验证和理解:他知道哪些路走不通,为什么某个定义关键,新的技巧可能还能用在哪里。证明的产生、正确性判断和思想形成,大体捆绑在同一段劳动里。

Astra 把这三件事拆成了速度不同的生产线:

答案生成正在变得很快;形式正确性开始能被机器化;理解、判断重要性和共同体吸收仍按人的速度前进。
研究型 AI 的可信进展取决于生成、验证、解释、吸收与复用中的最慢环节
研究型 AI 的可信进展取决于生成、验证、解释、吸收与复用中的最慢环节

这条主轴,也能把最近数学家看似分散的评论放到一起。Astra 发布只有四天,十个子领域当然还来不及形成完整的独立审查;下面这些判断主要来自此前几个月对 AI 数学的长期观察,以及发布后三天的一则最新公开表态。

观察者他在强调什么放到 Astra 上怎样理解
Jacob Tsimerman研究结果开始成规模出现,生成“有意思的数学”可能加速 10 倍、100 倍;同时年轻数学家的技能结构会经历动荡这是产能冲击。十项结果合起来的分量大于任何单项,因为它显示同一模型的横向迁移。Tsimerman 已宣布加入 OpenAI 做安全研究,这一机构关系也应一并看到
Terence Tao把数学分成生成、验证与消化;AI 和形式化让前两者远快于后者。得到目的地,不等于铺好了后来者能走的路这是知识生产方式的冲击。更长、更快的证明不自动带来更快的数学进步
Ken Ono 与 Tao模型已经能以非常像专家的口吻给出论证。Ono 称之为 “proof by intimidation”;Tao 认为流畅写作与正确性之间原有的信号已被打破这是信任冲击。论文写得像真的,已不能像过去那样充当可靠性线索
Leiden Declaration 与 Peter Scholze证明不仅提供确定性,也应提供“为什么是真的”的理解;数学的产物还包括清晰、判断与共同体能力。Scholze强调数学研究的目标是人的理解这是价值尺度的冲击。如果只按结果数量评价,研究会被推向最容易自动化、最容易宣传的方向

四种判断并不完全同调:Tsimerman 更看重规模化的可能,Leiden Declaration 更警惕产业激励,Tao 试图给出一套过渡期的工作框架。但它们共同指向一件事:“证明已经出现”不再等于“数学工作已经完成”。

2026 年 8 月 4 日,Astra 发布三天后,Tao 在一则没有点名具体公司或项目的公开帖里提出:谁要为生成一个证明领取声誉,就应尽最大努力把它继续养到至少可发表的阶段——包括讲解、报告和同行评审,而不是把中间产物交给共同体无偿收养。这几乎是对“证明丰裕”时代最具体的一条责任规范。

基于陶哲轩框架扩展的六阶段证明消化链路
基于陶哲轩框架扩展的六阶段证明消化链路

图中前五个发展阶段来自 Tao 的框架;这里把“共同体消化”单独列出,是为了区分一篇论文被接受与一套方法真正进入他人工作之间的距离。机器的时间尺度是小时和天,后半段往往是月、年甚至一代人。

5. 现在该相信到哪一步

Astra 的交付已经明显超过一段聊天答案。现在公开的是三套互相补充的接口:自然语言论文告诉人们结果与论证结构;reasoning walkthroughs 回顾关键转向和失败路线;Lean 证书检查形式化命题是否能在给定定义、公理和依赖下推出。

从开放问题、Astra 搜索、论文整理、Lean 形式化到共同体独立审查的五段链路
从开放问题、Astra 搜索、论文整理、Lean 形式化到共同体独立审查的五段链路

这套交付把“请相信模型”变成了“请检查论文和证书”,是实质性的进步。但 Lean 解决的主要是形式推导,不会自动回答四个问题:形式命题是否完全对应原问题,结果是否真正新颖,前人贡献是否归因完整,以及这套证明是否值得被领域吸收。

为什么还要把独立审查单列?OpenAI 自己此前的 First Proof 经历给过一个很具体的提醒:团队最初认为第 2 题的证明很可能正确,官方评注和共同体分析后来显示它是错的;当时的流程还包含人类挑选少数尝试中的最佳版本、建议重试和模型间互相检查。这个案例不等同于已有 Lean 证书的 Astra,但它说明了内部判断、自我检查、形式验证与外部共同体审查是不同层次,不能互相冒充。

截至 2026 年 8 月 5 日,比较稳妥的边界是:

可以确认还不能确认
OpenAI 公布了十项研究级新结果、249 页稿件、发现过程回顾和 Lean 代码,并公开承担正确性责任十项结果已经分别获得对应子领域的独立共识或期刊审查
找到这十个解法所需 token 按 Sol API 费率约 2,000 美元随机开放问题的平均成功率,或完整项目的训练、筛选、失败搜索和人工成本
同一模型跨多个差异很大的数学方向产出了可检查成果整条数学研究链已经自动化,或人类选题、解释与理论建设已不再重要

所以,合理的态度既不是把它降格成“又一个 benchmark”,也不是在四天内宣布数学已经改朝换代。应当承认:候选证明生成和形式化确实跨过了一个新门槛;十项具体结果的学术位置仍要交给十个领域分别判断。

6. 回到我们:别让更高产能变成更大噪声

这件事对我们的借鉴,不是“也让模型多写十份答案”,而是重新定义什么叫交付完成。

交付单位应当是“可信理解单元”

一个答案只有在同时带着结论、证据、解释和状态时,才值得进入下一项工作。对研究任务,它可能是论文、实验、形式证书和归因;对工程任务,它可能是设计说明、测试、运行记录和明确的已知边界。

真正有用的成本指标,也不再是“一个答案用了多少 token”,而是:

每个经独立验证、被人理解、能被下一项工作复用的知识单元,成本是多少?

这会自然带出验证通过率、专家复核时延、返工率和几个月后的复用率,而不是只看第一次生成的速度。

生成、验收和解释需要不同的责任人

同一个模型可以帮忙自检,但不应由同一条推理链独自宣布自己正确。高价值结论至少要有一层异源验证:编译器、测试框架、形式检查器、独立评测模型或领域专家。风险越高,验收链越要独立。

同样重要的是给“解释”明确归属。谁负责把结果讲到别人能够质疑?谁说明它与旧方法的差别?谁把它沉淀进规范、知识库或下一代评测?如果没有负责人,生成得越快,团队只是更快地制造无人认领的中间产物。

像管理技术债一样管理“消化债务”

模型产出增加以后,组织会出现一种新的债务:结论似乎成立,却还没有被独立复核;报告已经写完,却没有进入团队共同语言;方案已经验证,却没有被下一个项目复用。

最小闭环可以很朴素:

问题池 → 多路候选 → 机器校验 → 独立复核 → 解释与归档 → 被下一项工作复用

每个结果都要知道自己停在哪一站。只有走到最后,模型的产能才变成组织的能力。

结语

Astra 最值得记住的,不是一个容易传播的“2,000 美元解十题”,而是一次知识生产结构的显影:

答案、正确性和理解,第一次有可能在大规模研究中以三种不同速度前进。

这会让证明变得丰裕,也会让判断、解释、选题和共同体信任变得更昂贵。下一代科研基础设施如果只建设更强的证明机器,最终得到的可能是一条拥堵的审稿队列;真正重要的是同时建设把机器结果转化为可信、可理解、可传承知识的接收系统。

主要来源

Visual provenance

  • Renderer:确定性 SVG(非 ImageGen)。
  • 正文视觉:ten-results-map-v2.svg、human-effort-baseline.svg、representation-switches.svg、research-production-function.svg、tao-proof-funnel.svg、astra-workflow.svg。
  • 资料快照:2026-08-05。
  • 人类基准图:年份取自十项论文各章的历史回顾;表示问题公开提出或相关长期基准距 2026 年的自然年,不表示连续投入的人年或可货币化总成本。
  • 说明:图示服务于“答案—正确性—理解脱钩”的分析主轴,不替代具体数学证明;十项结果地图不按重要性排序。