研究者与 OpenAI 未发表数学合作的信任裂缝再起:Agent 工具链与学术合作可信度的边界 2026 年 9 月,数学界最具影响力的在世数学家之一 Terence Tao(陶哲轩)在 mathstodon 上发表了一篇引发广泛共鸣的短文,核心论点是:好的、富有成果的开放数学问题正在被以一种"不可再生"的方式快速挖掘殆尽——研究方向的稀缺性已经显现。更关键的是他在文中提到的一种新现象:"We h

研究者与 OpenAI 未发表数学合作的信任裂缝再起:Agent 工具链与学术合作可信度的边界

2026 年 9 月,数学界最具影响力的在世数学家之一 Terence Tao(陶哲轩)在 mathstodon 上发表了一篇引发广泛共鸣的短文,核心论点是:好的、富有成果的开放数学问题正在被以一种"不可再生"的方式快速挖掘殆尽——研究方向的稀缺性已经显现。更关键的是他在文中提到的一种新现象:"We have now seen that even the rumor of someone working on a problem can trigger a massive amount of AI-powered effort to flatten it before the original research project has time to reach its full potential. The incentives may now be pointing in the direction of no longer sharing any promising research directions with the broader community, which would reverse centuries of traditions of open science and do serious long-term damage to the future of the field."

陶哲轩的这次表态,直接揭示了过去 12 个月里在数学界持续发酵的一个深层危机——研究者与 OpenAI 在"未发表数学合作"上的信任裂缝。这条裂缝不是单一事件,而是由多起独立但相互印证的争议叠加而成:研究者与 OpenAI 共享未发表思路后,发现这些思路在极短时间内被 AI 工具链"扁平化"输出,原创研究者在自己的思路上反而失去了先发优势;更有研究者发现,自己与 OpenAI 研究员私下分享的解题方向,出现在了 OpenAI 内部 Agent 自动化产出的解法里,但 OpenAI 既没有给学术署名,也没有在公开发布时标注思路来源。

这种裂缝之所以在 2026 年集中爆发,根本原因是 AI Coding Agent 的工具链能力达到了一个临界点。OpenAI 在 2026 年 9 月 6 日发布的内部博客"Research acceleration: The view inside OpenAI"中披露:2026 年是 OpenAI 内部"agentic engineering 真正起飞"的一年,研究员大规模使用 Agent 辅助研究,7 月底 GPT-6 Astra 在内部上线后,人均 AI 算力消耗出现了一个显著跃迁。Simon Willison 在评论中直接指出:"2026 has been the year that agentic engineering really took off at OpenAI." 这种内部生产力的跃迁,反过来意味着任何外部研究者分享给 OpenAI 研究员的未发表想法,在几小时内就可能被 Agent 流水线消化、生成候选解法、甚至跑出多条竞争性思路,使得原研究者的相对优势被严重稀释。

三起标志性事件:从合作到裂缝

回看 2025 年下半年到 2026 年上半年的几起关键事件,可以把"未发表合作"的信任演变梳理出一条清晰脉络。

第一起是 2025 年 10 月公开的 arXiv 论文 2510.26647"Accelerating mathematical research with language models: A case study of an interaction with GPT-5-pro"。这篇由独立研究者 Adil Salim 发表的论文,记录了他与 GPT-5-pro 合作证明凸优化中一个引理的全过程。论文的核心价值不在数学结果本身,而在详细记录了"Agent 协作推理"的过程:GPT-5-pro 加速了研究进度、提示了相关的探索方向、证明了一些中间结果,但它的推理过程仍然需要专家仔细监督,特别是在纠正微妙错误上。Adil 在论文最后明确指出:"we do not claim with certainty"——数学结果的新颖性他都不能肯定,因为他无法判断这些思路是否在 GPT-5-pro 的训练数据里见过。这种诚实的表态,成为了"未发表合作"如何被发表的第一个公开范本。

第二起是 2026 年初陶哲轩本人参与的 IMO 2025 数学竞赛解题实验。当时 OpenAI 内部研究员与陶哲轩团队进行了非正式的解题协作,Agent 工具链在 IMO 几何题、代数题上达到了接近金牌水平的解题能力。这次合作虽然最终公开了部分结果,但陶哲轩在后续多个场合反复提醒:Agent 在 IMO 这种结构化问题上表现优异,但是在需要长期构思、需要研究者主动选择方向的"研究型问题"上,Agent 还没有展现独立发现新思路的能力。这次合作的副产品,是 OpenAI 内部对"未发表思路共享"的边界开始变得谨慎。

第三起是 2026 年 8-9 月集中爆发的"算力挖矿"争议。多位数学家在社交媒体和私人邮件中提到,他们与 OpenAI 研究员分享的某个开放问题方向,在数天之内就被 Agent 工具链产出了多条接近完成的解法路径,而这些解法的"思考风格"高度相似于他们分享时的表述方式。这种情况引发了数学界对"未发表思路的事实泄露"的普遍担忧:即使 OpenAI 没有公开发布这些解法,Agent 在内部训练或产品迭代中使用这些思路,也意味着原创研究者在自己想出的方向上失去了先机。

信任裂缝的工程根源:Agent 工具链的能力跃迁

要从工程层面理解这条信任裂缝,必须回到 Agent 工具链在 2025-2026 年间的具体能力跃迁。OpenAI 首席科学家 Jakub Pachocki 在 2026 年 9 月的署名文章"An Alien Mind"中提到:"The strongest argument I see for continuing to train much smarter models quickly is the need to build defensive systems against the dangers posed by other AI." 这段话表面是在讨论 AI 安全,但其中暗含的工程现实是:OpenAI 自身的 AI 工具链已经达到了"可以独立产生高质量研究方向"的水平,这种水平既是公司内部研究加速的核心动力,也是对外研究者信任裂缝的源头。

具体到数学研究领域,Agent 工具链在 2026 年达到的工程能力包括:第一,基于已发表论文自动提炼可研究方向的能力,这一项在 2024 年就已经基本成熟;第二,基于与研究者的对话历史自动生成"该方向的多条可能路径"的能力,这一项在 GPT-6 Astra 内部上线后变得显著强大;第三,在不联网的情况下根据训练知识自动给出长程解法思路的能力,这一项是 2026 年最让学术界担忧的新能力——因为它意味着 Agent 可以完全基于自己的"记忆"复现研究者的原创方向,而无法被外部工具检测到。

这种工程能力分布的不对称,使得"未发表合作"对原创研究者变得越来越不利。研究者分享一个想法,可能需要数周到数月才能把想法推进到可发表的状态;而 Agent 在接收到这个想法的几个小时内,就能产出多条可能路径的探索结果。在数学这种对先发权极为敏感的领域,这种时间差足以让原创研究者丧失大半的学术回报。

可信度边界:哪些合作可以继续,哪些必须暂停

面对这种工程现实,数学界在 2026 年下半年开始自发地划定一些可信度边界。第一类边界是"未发表思路不外传"。越来越多的数学家选择把研究方向保留在内部,不再通过邮件、社交媒体、或者会议非正式交流向 AI 公司研究员透露。这种"信息封锁"虽然保护了原创性,但确实像陶哲轩所说,"会逆转数百年来的开放科学传统,对数学领域的长期发展造成严重损害"。

第二类边界是"合作必须可追溯、可署名、可监督"。一部分研究者开始要求 AI 公司在合作开始前就签订明确的协议:Agent 在对话中产出的所有方向性思路,必须记录来源(是基于用户的输入、基于已发表论文、还是基于 Agent 自身推理),并且在最终发表时给出明确的学术归属。这种协议在过去学术合作中是非常自然的——人类合作者之间的贡献归属有成熟的学术规范——但 Agent 协作中的归属问题一直没有被严肃讨论。

第三类边界是"对低质量合作说不"。Adil Salim 的论文给出了一个值得借鉴的范式:在与 GPT-5-pro 合作证明一个引理时,他明确写出了"we do not claim with certainty"——即使结果看起来正确,他也不愿意在没有独立验证的情况下把功劳揽到自己身上。这种学术克制,是 Agent 时代数学家维护自己可信度的重要方式。

对 Agent 工具链设计的启示

这条信任裂缝的存在,意味着 AI 厂商在 Agent 工具链设计上需要主动加入"反滥用"机制。具体来说,有三个工程方向值得立即投入。

第一,Agent 应当能够识别并标记"用户输入的原创未发表思路"。当前的 LLM 在对话过程中并不会主动区分"用户分享的已发表内容"和"用户分享的未发表原创思路",但这种区分在学术合作场景下至关重要。一个简单的工程实现是让 Agent 在每次用户提供方向性思路时,先反问"这个方向是已公开的还是您原创的",并把回答记录到对话历史里。

第二,Agent 产出的"方向建议"必须明确标注来源。如果一个研究方向完全基于用户的输入,Agent 在引用时必须显式标注;如果基于已发表文献,必须给出引用;如果基于 Agent 自身的训练知识,必须明确说明。这种来源透明性,可以让研究者在评估 Agent 的贡献时做出更准确的判断。

第三,Agent 工具链的"研究加速"应当有审计机制。OpenAI 在内部博客中展示的研究员人均算力增长曲线,如果能同时披露这些算力消耗对应了多少篇公开发表的论文、多少个研究方向被分享,那么外部研究者就能对"OpenAI 在多大程度上依赖外部输入"做出评估。这种透明度,是修复当前信任裂缝的最关键一步。

回到信任的修复:学术合作的下一步

把视角拉回到信任本身,数学界与 OpenAI 的关系并不应该也不可能回到"信息完全开放"的过去。Agent 工具链的能力已经达到了不可逆的水平,要求它"忽略"用户分享的未发表思路,在工程上既不可能也不合理。但同时,学术合作的可信度边界也确实需要被重新划定。

一种可能的修复路径是建立"学术合作透明度标准"。具体来说,任何 AI 公司在公开发布 Agent 工具链时,都应当披露三个指标:Agent 是否使用用户输入作为训练数据或推理依据;Agent 在研究方向建议上的归属透明度;Agent 是否会基于用户输入自动产出"竞争性解法"。这三个指标的标准化披露,可以让数学界在选择合作对象时有清晰的判断依据。

另一种修复路径是建立"Agent 协作的引用规范"。类似于学术论文有严格的引用格式,Agent 协作产生的成果也应当有明确的引用规则:用户的输入必须被引用,Agent 的产出必须被标注,关键决策点必须记录推理过程。这种规范一旦被数学界主流认可,Agent 协作的可信度问题就能得到实质性缓解。

陶哲轩在 2026 年 9 月的那段话,实际上是对数学界的一次预警:如果不主动建立这些规范,开放科学传统可能被 Agent 工具链的能力跃迁所侵蚀;但如果主动建立规范并且让 AI 厂商共同遵守,Agent 工具链完全有可能成为数学研究的新生产力基础,而非原创性的威胁。这条裂缝是否能够修复,取决于数学界与 AI 厂商是否愿意在接下来的 12-24 个月内共同投入建设可信度边界,而非让裂痕继续扩大。