能力已经出现。下一个前沿是效率,以及泛化到数学之外的每一门学科。
2026.05,通用推理模型推翻 1946 年的单位距离猜想,九位顶尖数学家联署确认。
2026.10.06 一次性发布;次日因一处符号错误撤回 3 篇、修订 14 篇。
2026.09,证明有限时间内会出现奇点,Lean 形式化验证再用 17 小时。
Navier–Stokes 一项:约一万个智能体、270 万条消息。
来源:OpenAI 官方发布(2026.05、2026.09、2026.10);github.com/openai/math
模型一天能提一万个假设。真正卡住的是:哪个是对的,验证一次要多久。
模型提出假设,给出可检验的预测;验证器与实验判定真假;判定的结果回到数据里,训练出更强的模型。一圈转完,下一圈的起点更高。
模型对同一道题采多条思维链,把卡住的岔路口标出来。过程数据让奖励知道该给哪一步,而不是只看最后那个答案。
答案、数值、证明或脚本 —— 每一条都必须能被某个判据明确判对或判错,不靠感觉。
判据库、单元测试、数值仿真承担日常奖励;专家与真实实验只在关键处抽查标定。
被否掉的分支、失败的实验一起回流:它们同时是 SFT 轨迹和 RL 偏好对。
全对或全错都没有信号,题要刚好够得着。
难度校准的题库与私有评测,按学科与强度分级的年度授权。
验证器一宽松,模型就会钻空子。
判据库订阅;便宜层做 RL 奖励,昂贵层定期校准。
722 篇论文发布次日,撤回 3 篇、修订 14 篇。
把论文、仿真与实验转成结构化条目、裁判模型、过程数据。
模型会推导,缺的是方向。模型对每道题采 8 条回答,只把卡住的岔路口发给专家,附上 3–4 个候选方向。
产出效率从约 1.3 条 / 专家小时,提升到约 30–50 条 / 专家小时。单条成本降到三十分之一。
一次专家动作,同时产出 SFT 轨迹和 RL 偏好对:被否掉的分支,本身就是奖励信号。
数学验证免费但产出贵,化学产出便宜但验证贵:数学打磨方法,化学放大规模。
| # | 领域 | 验证方式 | 状态 |
|---|---|---|---|
| 1 | 数学 / 计算机 | 验证几乎免费 | 已进入 L3,正走向 L4 |
| 2 | 计算科学:理论物理、计算化学、计算材料 | 模拟器可靠 | 可大规模闭环 |
| 3 | 实验化学与材料 | 模拟器 + 自动化实验室 | 下一站:闭环接入真实世界 |
| 4 | 分子 / 结构生物学 | 大数据库 + 蛋白设计工具 | 湿实验仍然慢 |
| 5 | 细胞 / 系统生物学、医学 | 模拟器不可靠 | 慢、贵、噪声大,有伦理问题 |
| 6 | 野外科学 / 社会科学 | 有些实验根本做不了 | 只能靠观测和预测后开奖 |
研究专家时间与模型提升之间的扩展规律,提供结构化数学数据与验证数据。
研究验证质量与成本如何影响学习效率,构建多保真度奖励栈。
让模型在计算科学里自己提方案、跑验证、迭代,服务产业科学智能体。
接入自动化实验室,把每一次实验(包括失败)沉淀为训练数据。
数学家、机器学习研究者与工程师,一起定义什么算对。
团队成员来自 清华大学·北京大学·南开大学,以及 华为·字节跳动·MiniMax 等机构的 AI 与科学研究者。
维护专家网络、判据库与多保真度奖励栈,决定「什么算对」。
把论文、仿真与实验转成结构化条目、思维链与偏好对。
构造可验证的 RL 环境、奖励接口与训练管线。