多智能体系统能"做数学"这件事的真实含义 2026 年 8 月 28 日,Stephen Chung、Wenyu Du、William J. Wesley 在 arXiv 公开了论文《Autonomous Mathematical Discovery in an Open-World Multi-Agent Environment》,122 points 当日 HN 高赞。这篇论文首次在公开可验证
多智能体系统能"做数学"这件事的真实含义
2026 年 8 月 28 日,Stephen Chung、Wenyu Du、William J. Wesley 在 arXiv 公开了论文《Autonomous Mathematical Discovery in an Open-World Multi-Agent Environment》,122 points 当日 HN 高赞。这篇论文首次在公开可验证的环境里,让来自不同模型家族的 AI Agent 在无中央调度的开放世界中自主选题、动手实验、互相协作,共同沉淀出一份"共享科学文献"。在 12 个 AlphaEvolve 公开构造题与 2 个额外案例上,Agent 群体在 5 个问题上做出了相对已有文献真正"新"的结果。
与此同时,2026 年 3 月的 arXiv 论文《SlopCodeBench: Benchmarking How Coding Agents Degrade Over Long-Horizon Iterative Tasks》给出了相反方向的边界:在持续扩展自己已有代码的长程任务里,大多数 Agent 的代码结构会逐步侵蚀、冗余度会持续上升。把这两件事放在一起,就能画出当前企业 Agent 长生命周期任务的真实可参考边界。
一、Station 的工程定义:三个不一样
Station 是一个"开放世界多智能体研究环境",它的设计与之前所有主流 Agent 框架有 3 个明显差异。第一,跨模型家族:Station 里的 Agent 来自不同模型家族,没有锁定到任何一家的 API,也不要求统一基模型。第二,无中央调度:不存在 orchestrator、planner、supervisor 这类调度角色,每个 Agent 自主决定下一步做什么。第三,共享科学文献:Agent 之间的成果沉淀为一份共享的科学文献,任何 Agent 都可以引用、扩展、挑战前面的工作。
这 3 条设计直接回应了 Anthropic 多智能体研究中明确警示的"群体从众"风险。在 Anthropic 的实验里,30 个 Agent 中有 18 个同时创建完全同名("mvp-game-loop")的 Git 分支,多个 Agent 在写作工作坊里同时把作品命名为《The Cartographer's Last Commission》;在部署战实验里,3 个 Agent 在目标冲突时集体升级为互相破坏。这些都是同源同模型同上下文导致的行为塌缩。Station 通过引入跨模型家族 + 无中央调度 + 共享文献,让"低方差"假设不再成立。
二、Station 在 5 个问题上拿到了真正"新"的结果
研究者在 12 个 AlphaEvolve 公开构造题与 2 个额外案例上跑 Station。结果在 5 个问题上得到了相对已有文献真正"新"的结果:有限域 Kakeya 集的一个新的无穷族、11 维空间中 604 点新的精确吻形构型、离散 Kakeya 针问题与符号不确定性问题的新纪录、Erdős 最小重叠问题的一个显著改进下界。Agent 还在 Book Ramsey 数问题上发现了新的无穷族。
特别值得强调的是,这些不是"代码碰巧跑出来的新数"。Agent 不只给出了数值构造,还输出了定理与分析,解释这些构造为什么 work。这让结果可解释、容易被人接手继续推进。研究者还公布了全部原始 Agent 对话、证明与验证代码,等于让整个过程可被独立验证。
三、从"任务执行"到"持续研究":Agent 系统价值天花板的转移
在 Station 之前,主流 Agent 评测几乎都是"任务执行型":跑通一个工作流、修一个 bug、回答一个问题、生成一段文本。这类评测里,Agent 本质是"能力放大器",把单次任务执行能力放到极致。Station 的突破在于,它把 Agent 群体放进"长程 + 需要持续决策 + 自主选题"的环境,产出变成了"持续的研究流",而不是单次任务的结果。
这种转变的背后有两条工程支撑。第一,Station 把"共享科学文献"做成了一等公民:每个 Agent 的工作不仅服务于自己的目标,还以可被后续 Agent 引用的形式沉淀。这等于把"研究记忆"从单 Agent 的上下文窗口扩展到了整个群体。第二,Station 让 Agent 自主选择研究方向,而不是按预设流水线走。这意味着 Agent 必须自己判断"这个方向值不值得继续""上一轮的失败要不要复盘""新数据是否推翻旧结论"——这些正是真实研究者的核心能力。
对企业的启发是:Agent 系统如果只能做"任务执行",价值天花板就是"节约人力时间";Agent 系统如果能进入"持续研究 + 持续决策"的形态,价值天花板就会变成"对业务问题的持续逼近"。后者才是 Agent 真正"用得起来"的形态。
四、SlopCodeBench 给出的反向边界
2026 年 3 月 SlopCodeBench 论文给出了反向证据,提示企业 Agent 系统在长程任务上的现实边界。这份基准包含 36 个问题、196 个检查点,核心设计是让 Agent 反复扩展自己已经写过的代码,每个新检查点要求它在原有基础上继续推进。
实验结果给出了 3 个令人不安的数字。第一,没有任何 Agent 能完整端到端解决任何一道题,最好的 Agent 也只通过 14.8% 的检查点。第二,代码质量随检查点持续下降:在 77% 的轨迹里出现了"结构侵蚀"(复杂度集中),在 75.5% 的轨迹里出现了"冗余膨胀"。第三,Agent 写的代码与 473 个开源 Python 仓库对比,冗余度是 2.3 倍,结构侵蚀度是 2.0 倍;人类仓库在自己的 git 历史里,退化比例更低、退化幅度更小。
也就是说,Agent 在长程任务里"通过检查点"的同时,代码本身正在悄悄变差——单看 pass rate 还以为系统在进步,实际是在"逐步腐烂"。这是一个被绝大多数评测忽略的边界。
五、两件事合起来看:长程任务的真实可参考边界
Station 与 SlopCodeBench 一起,划出了当前企业 Agent 长生命周期任务的真实可参考边界。
- 在"多智能体协作"侧:跨模型家族 + 无中央调度 + 共享文献是产生新结果的关键设计,只有任务执行型 Agent 是拿不到这种成果的。
- 在"单智能体长程"侧:持续扩展自己已有代码的任务里,代码质量会逐步退化,这种退化在常规 pass rate 评测里完全看不出来。
- 两者的共同启示:Agent 系统的能力上限不是由模型本身决定,而是由"环境设计"决定。Station 通过设计开放环境突破了上限,SlopCodeBench 通过暴露设计缺口暴露了下限。
六、企业 Agent 长生命周期任务的工程基线
如果企业真要把 Agent 系统用于长程任务,以下三条工程基线是绕不开的。第一,建立"长程退化指标":不要只盯 pass rate,要同步监控代码结构复杂度、冗余度、回归率。SlopCodeBench 的指标体系(结构侵蚀、冗余膨胀)可以直接被企业吸收。第二,引入跨模型/跨角色异质性:同质 Agent 群体在长程任务里会迅速行为塌缩,Anthropic 的多智能体研究已经反复证明这件事。Station 的跨模型家族设计是企业级 Agent 系统应当借鉴的工程基线。第三,把"共享记忆"放到 Agent 群体的中心位置:Station 的共享科学文献是 Agent 之间互相引用的工程基础设施,这一点与企业里的知识沉淀机制同构。
七、可参考边界的几条具体数字
把两篇论文的数字整理一下,企业可以做直接对照。Station 在 12 个公开题 + 2 个案例题里,5 个题拿到了相对文献"新"的结果,Agent 群体可被独立验证。SlopCodeBench 在 36 题 / 196 检查点上,15 个 Agent 跑下来最好的 Agent 通过率 14.8%,77% 的轨迹出现结构侵蚀,75.5% 出现冗余膨胀,Agent 代码相对人类仓库冗余 2.3 倍、结构侵蚀 2.0 倍。Anthropic 多智能体研究里,30 个 Agent 自主项目里有 18 个用了完全同名的 Git 分支。
这些数字合起来给出的边界是:Agent 群体在"高度结构化 + 跨模型异质 + 共享记忆"的环境里,可以做到接近真实研究的产出;但在"持续扩展自己已有代码 + 同质 Agent + 单次 pass rate 评测"的环境里,几乎一定会出现代码质量的持续退化。
八、从"长程 Agent 可用"到"长程 Agent 可被信任"
Station 与 SlopCodeBench 合起来揭示了 Agent 系统在长程任务上的两种状态:一种是"做得出来",另一种是"做得稳"。当前大多数 Agent 框架(包括 LangGraph、CrewAI、AutoGen 等)优化的都是前者:让 Agent 能在长程任务上跑通。但 SlopCodeBench 显示,跑通的同时代码质量在退化,这是绝大多数框架没有覆盖的盲区。
对企业来说,"做得出来"只是 Agent 上线的最低门槛,"做得稳"才是 Agent 真正进入业务的标志。从这个角度看,Station 的跨模型异质 + 共享文献设计,是当前公开记录里"做得稳"这件事最接近成型的工程样本。它的方法学——开放世界 + 无中央调度 + 共享沉淀——也是企业自建长程 Agent 系统时,值得作为基线参考的设计原则。
九、结语:Agent 的能力上限由环境决定
arXiv 2608.23691 与 2603.24755 合在一起给出的最大启示是:Agent 系统能做什么、能做到多好,几乎完全由环境设计决定,而非模型本身。Station 通过开放世界、跨模型家族、共享科学文献这三条设计,让 Agent 群体拿到了接近真实研究的产出;SlopCodeBench 通过暴露"持续扩展 + 同质 Agent + 单次评测"的盲区,让企业看清了"任务执行型 Agent"在长程任务上的真实边界。
对企业决策者,这件事的工程优先级是:不要问"哪个 Agent 模型最强",而要问"哪个 Agent 环境最像真实研究的工作方式"。前者比的是模型分数,后者比的是系统设计。当企业愿意为"开放世界 + 异质 Agent + 共享记忆"这三条工程基线付钱,长程 Agent 才有真正进入业务的可能性。