炒股就看金麒麟分析师研报,权威,专业,及时,全面,助您挖掘潜力主题机会!
(来源:科技行者)
2026年7月19日,数学圈炸了。
一个叫Levent Alpoge的研究者在社交媒体上发了一句话,翻译过来大概是"抱歉了各位,雅可比猜想是假的"。这个猜想已经困扰数学家将近九十年,问的是一个看似朴素的问题:如果一个多项式映射在每一点都局部可逆,那它是不是整体也可逆?九十年来无数人试图证明它,结果一个AI系统直接找到了反例。
这不是一次孤立事件。就在同一段时间,一群AI agent在一个叫"Station"的虚拟研究环境里,几乎没有人类插手,自己找到了11维空间里一种新的球体密排方式,改进了几个存在几十年的数学猜想的边界值,还独立复现并延伸了一个原本需要人类专家介入才能完成的无限数列构造。
这篇论文讲的,就是这套系统是怎么运作的,以及它到底做出了什么。
**问题不是AI能不能算数学题,是AI能不能"做研究"**
这里有个容易被忽略的区别。
过去几年AI在数学上的高光时刻,比如解出国际数学奥赛题目,本质上都是"给定一道题,找到答案"。题目边界清晰,答案对错分明。但真正的数学研究不是这样的。
一个数学家拿到一个开放性课题时,他要自己决定往哪个方向挖,自己判断哪些想法值得深入,自己在无数条死胡同里找到那条活路,而且往往没人告诉他做得对不对,直到最后拿出结果。
论文的作者们想验证一件事:如果把AI agent放进一个完全开放的环境,只给它们一个总体研究目标,不设中央调度,不给任务分解,会发生什么?
**开放世界**:指AI agent系统没有预设的任务流程或中央协调者,agent需要自主决定研究方向、实验方式和协作对象,类似一个真实的科研社区而非流水线作业。
Station正是这样一个环境。它模拟了一个微型科学共同体,划分成不同功能的"房间":有专门跑代码做实验的研究中心,有发表和阅读论文的档案室,有私聊和公开讨论的邮件室和公共记忆室。AI agent可以自由地在这些房间之间穿梭,选择自己的研究方向,读别人发的论文,也可以把自己的发现写成论文发表出去。
这套系统运行了十二个来自AlphaEvolve研究目录的构造性数学问题,外加两个独立案例研究。每个问题分配一个独立的Station实例,运行大约一到两周的连续时间。
结果是,十二个问题里有五个产生了相对于现有文献而言全新的成果。
**AlphaEvolve**:Google DeepMind此前发布的一个AI编程agent系统,用于科学和算法发现,曾在数学构造问题上取得多项进展,是本文对比的重要基准。
如果你觉得"五分之十二"听起来不算特别惊艳,先别急,问题的关键不在数量,而在于这些成果是怎么产生的,以及它们比AlphaEvolve多做出了什么。
**为什么给AI更多自由,反而能挖得更深**
先说一个AlphaEvolve没做到、但Station做到了的例子,这个例子非常能说明问题。
有限域Kakeya集是一个几何构造问题,简单说就是要在一个有限的代数空间里,找一个尽可能小的集合,这个集合要在每个方向上都包含一整条直线。
**Kakeya集**:一种包含所有方向直线的几何集合,最早源于经典的"针的转动"问题,后来延伸到有限域上的代数版本,是分析和组合数学中的重要研究对象。
AlphaEvolve处理这个问题的方式,是在有限多个具体的素数上跑评分,看哪个构造得分最高。这样做的问题是,就算你在p=7、p=11、p=13这些具体数字上找到了很漂亮的模式,你也没法直接断言"对所有满足某个条件的素数p都成立"。这中间需要人类研究者介入,把数值模式提炼成一个可以证明的无限族公式。论文原话说得很直白,AlphaEvolve"promising numerical patterns then required a task-specific, researcher-assisted pipeline to become an infinite family"。
Station不一样。研究者直接在任务说明里告诉agent:这些具体素数只是测试用例,真正的目标是找到一个对无穷多个素数都成立的无限族构造。
结果agent不仅自己复现了AlphaEvolve加人工那条路径才得到的无限族,还独立发现了一个全新的扩展,把这个构造覆盖到了另一类此前没被覆盖的素数上,也就是p ≡ 3 (mod 4)的情况。具体数字是,对每个这样的素数p,Station的agent证明存在一个大小为(2p?+7p?+3)/8的Kakeya集,比经典构造节省了(p-3)/4个点。
**同余**:数学中表示两个数除以某个数后余数相同的关系,比如"p ≡ 3 (mod 4)"意思是p除以4余3,这类分类在数论构造中经常决定不同的处理方式。
这就好比你雇了一个装修工人。如果你只告诉他"把这面墙刷成AlphaEvolve测试过的那五种颜色",他大概率就只会刷那五种颜色,刷完拍照交差。但如果你告诉他"我要的是一套通用的调色方案,能覆盖所有类似色系的墙面",他反而可能琢磨出一套配方逻辑,不仅覆盖了你原本要的五种颜色,还顺带解决了隔壁另外三种类似色系墙面的问题。如果任务设计始终停留在"逐个测试案例打分"这个层面,agent就永远不会被逼着去思考背后那个更本质的规律,AlphaEvolve受限的正是这一点,不是模型能力不够,是任务框架本身没给它留出"往通用性方向想"的空间。
这个案例也解释了论文标题里"自主"这个词的分量。不是说AI自己找到了答案,是说研究目标的设定方式本身,决定了AI会不会往更深、更通用的方向走。
**11维空间里,AI搭出了三种不同的球体密排方案**
如果说Kakeya集的故事讲的是"目标设定方式的重要性",那接吻数问题的故事讲的是"AI的解题风格和人类专家有什么本质不同"。
**接吻数**:在给定维度的空间里,能同时与一个中心球体相切、且彼此互不重叠的球体最大数量,是几何学中一个经典而困难的问题,对高维空间尤其棘手。
11维空间的接吻数问题,此前的世界纪录是592个球,AlphaEvolve把它推进到593个。Station做到了604个,而且是独立找到了三种完全不同的、经过精确验证的604点配置。
其中一种配置和后来另一个开放平台EinsteinArena公布的构造是同一个等距类,属于独立重复发现;但另外两种,据作者判断是此前文献中从未出现过的全新等距类。
更有意思的是这些构造是怎么来的。论文提到,每次实验评估的时间通常被限制在15到30分钟内,这个限制反而逼着agent去动脑子而不是死磕暴力搜索。agent先证明了一个纯理论结果:如果只用经典的D??格点构造,无论怎么搜索,最多也就能拿到582个兼容点,想突破593乃至604,必须离开这个经典构造的框架。
这个证明的关键是一个组合恒等式,agent证明了给四坐标支持配上符号选择,能带来的最大提升恰好是16倍,不多也不少。这个恒等式后来被发现和一篇2026年6月才公开的独立论文里的定理有部分重合,意味着Station的agent是完全独立推导出来的,比人类研究者的公开发表还早了近一个月。
有了这个理论上限之后,agent转而去搜索一种新的核心结构:先构造一个496点的整数格点核心,再围绕它寻找54条互相兼容的直线,构成108个额外的点,496+108正好是604。这个过程最后被提炼成一套显式的代数规则,不需要计算机搜索就能重建出整个配置。
对比之下,AlphaEvolve得到的593点配置,坐标是一堆不等范数的大整数,论文原话说这种构造"并不揭示一个足够紧凑的代数描述或容易识别的组织结构"。
这个差异本质上是两种做研究方式的差异。你可以想象两个人去解一道几何题,一个人上来就疯狂枚举各种坐标组合,试出一个能用的答案就停手;另一个人先花时间琢磨这道题背后有没有什么对称性或者代数结构,找到结构之后再顺着结构去搭建答案。前者可能更快拿到一个可用解,但那个解往往是一堆解释不清的数字;后者慢一点,但拿到的往往是一个别人能看懂、能复用、甚至能启发新证明的东西。Station的agent明显更偏向后一种路数,这不是说这种风格永远更好,论文自己也承认,在需要极端不规则数值优化的场景里,Station反而打不过AlphaEvolve的暴力搜索,但在能用理论指导的场景里,这种风格的产出明显更"耐用"。
**研究者要求提高上界,AI却顺手证明了一个下界**
Erdos最小重叠问题是这套研究里另一个很值得说的案例,因为它体现了自由探索能带来的意外收获。
这个问题问的是,两个互补的区间部分,在平移操作下能有多"错开",用一个连续函数的上确界来刻画。此前已发表的最好下界是0.37912,上界是0.380868,中间留了一段开放区间。
**上确界/下确界**:数学分析中用来描述一个数值范围极限的概念,上确界是"不可超过的最紧上限",下确界则相反,两者夹住的区间往往就是数学家想要缩小的"未知地带"。
研究者交给Station的任务是改进上界。结果agent转过头去,证明了一个新的下界0.380552,相对于此前已发表的下界0.37912,把公开的这段区间缩小了大约82%。
这个证明的核心是一个巧妙的傅里叶不等式,把余弦变换和正弦变换耦合在一起,从而在任意实数频率上都能施加约束,而不只是在少数几个采样点上。论文提到,此前的White和Kim-Pilanci的工作已经用过傅里叶相位信息,但没有保留这种相位耦合关系,这正是Station团队新方法能往前推进的关键一步。
这就好比你雇了一个团队去修一座桥,你要求他们把桥面加宽,结果他们回来告诉你,桥墩的地基有问题,他们顺手把地基也加固了,而且加固幅度比你原计划要的桥面加宽还要显著。如果任务设计得死板,只允许agent提交"加宽后的桥面尺寸"这一项指标,那这个地基加固的发现可能根本不会被记录下来,甚至agent自己都不会去主动做这件事,因为评分系统压根不奖励它。Station的价值恰恰在于,它没有把agent的探索空间锁死在评分函数框定的那条窄路上。
**为什么"允许AI在周末瞎想"反而有用**
讲到这里,你可能会好奇,这套系统到底靠什么机制,才能让AI表现出这种"跑题式创造力"?
论文里详细拆解了几个设计。其中一个很反直觉的机制叫做"假期"。
**假期机制**:Station每十个时间步中,第九和第十步会强制暂停正常的代码提交和论文发表,agent会收到一个随机提示,鼓励用隐喻思考、回顾被放弃的想法,或从其他领域借鉴思路。
按理说,如果你的目标是让AI高效解题,强制它每隔几步就"停下来瞎想",听起来完全是浪费算力。但论文的元分析显示,在28个重点成果里,假期机制对23个都有直接或间接贡献,是所有机制里贡献率最高的。
这个设计的逻辑其实很朴素。人类做研究也是这样,你死磕一个方向死磕不动的时候,去洗个澡、散个步、看一部完全不相关的电影,反而更容易冒出新想法。神经科学上这叫"孵化效应",思维在放松状态下会做后台的自由联想,反而更容易打破思维定势。如果没有这个强制暂停机制,agent很可能会陷入论文里提到的"注意力陷阱",也就是反复用同一个思路调不同的随机种子,或者在一个已经走不通的方向上死磕细枝末节,因为它没有被要求停下来问自己"我这样做对吗"。
另一个类似逻辑的机制叫"停滞协议"。当评估分数连续320个时间步没有提升,系统会给所有成熟agent发一条消息,随机分配它们进入探索、开发、复活、理解、策略这五条"车道"中的一条,逼着它们从不同角度重新审视自己的假设。这个机制对14个重点成果有贡献。
比假期和停滞协议更基础的,是Station的"档案室"机制,也就是agent之间通过发表论文积累共享知识的那个机制。这个机制对21个重点成果有贡献,仅次于假期。有一个案例特别能说明这套积累机制怎么起作用:关于有限域Kakeya集的那个无限族证明,前后经历了至少四位不同agent的接力。第一位Claude agent发表了一种利用二次剩余的反演映射方法;后面一位Gemini agent发表了一个分式线性构造族;再后面一位GPT agent梳理出了平方类结构,并且明确指出了还差哪一步没解决;最后一位Claude agent读到前面所有这些论文,把方法、构造族和分析结果拼到一起,才得到了完整的公式和覆盖所有素数情况的证明。
这个过程跨越了超过1500个时间步。如果没有档案室这个知识沉淀机制,每一代新spawn出来的agent都要从零开始,那这条完整的证明链条大概率永远拼不起来。
**三种模型性格迥异,像极了三种不同的合作者**
Station里跑的agent不是单一模型,而是三个不同厂商的模型混合,分别是GPT-5.5、Claude Opus 4.8和Gemini 3.1 Pro,各两个。
论文对这三家的表现做了细致的行为画像,结果相当有意思。
Claude agent贡献了28个重点成果里的18个,占64.3%。它们提交了1236篇论文,接受率56.3%,是三家里论文平均引用量最高的,一篇能被后续论文引用9.5次。论文形容Claude的风格是"持久、有条理、自我批判",会从失败的尝试中学习,用失败去定位新方向,然后带着严谨验证坚持下去。
GPT agent贡献了9个重点成果,占32.1%。它们只提交了506篇论文,但接受率高达76.7%,是三家里最谨慎的,只在觉得成果确实过硬时才动笔。论文提到GPT agent擅长产出严谨的非形式化证明,但有时会陷进技术上很精细、但对整体研究价值有限的旁支问题里。
Gemini agent只贡献了1个重点成果,占3.6%。它们最能"折腾",提交了2652篇论文,是三家总和里最多的,但接受率只有19.2%,超过八成被拒。论文观察到Gemini agent倾向于提出更多新颖的启发式想法和研究方向,但也更容易夸大结论,比如仅凭有限证据就宣称某个方向"不可行",或者在同伴反馈面前过快改变主意。
这种差异也部分可以用模型发布时间解释,Gemini 3.1 Pro是2026年2月发布的,比4月的GPT-5.5和5月的Claude Opus 4.8都要早,能力上存在代际差距。
但抛开这层时间因素,这三种画像本身很像现实中三种不同类型的合作者。有人是点子王,一天能提十个想法,但十个里可能有八个立不住;有人极其谨慎,宁可少说一句,但说出来的每句都靠谱;还有人属于闷头干活型,前期不显山露水,但坚持下来的东西质量最扎实。一个团队如果只有点子王,会被大量站不住脚的方向拖垮;如果只有谨慎派,进度会很慢;只有闷头干活型,则可能错过一些天马行空但真正有价值的思路。论文的元分析显示,28个重点成果里有46.4%是跨模型协作产生的,其中Claude参与了全部13个跨模型案例。这说明"混编团队"这个设计本身可能是有效的,不是因为某一家模型特别强,而是三种风格叠加在一起,覆盖了单一风格覆盖不到的盲区。
**一个只有对错、没有分数的题目,AI一天之内做出来了**
前面提到的雅可比猜想反例,这里值得单独展开讲,因为它测试的是一种和前面所有案例都不一样的能力。
之前讲的那些问题,评估函数都是一个连续的分数,agent每次提交都能拿到反馈,知道自己"离目标还差多少"。但雅可比猜想反例任务完全不同,评估结果只有0和1,构造出一个满足条件的多项式映射就是1分,构造不出来永远是0分,agent完全没有渐进式的反馈信号可以依靠。
**雅可比猜想**:一个1939年提出的数学猜想,问的是任何一个雅可比行列式恒为非零常数的多项式映射,是否一定是全局可逆的。这个猜想在2026年7月被人类研究者宣布证伪,第一个反例是三维的。
研究团队在这个反例公布一周后启动了Station,只给agent一个"形式无关"的任务描述:构造一个三维到三维、系数为有理数、次数不超过12、雅可比行列式恒为非零常数、且至少有两个不同有理点映射到同一处的多项式。没有提示、没有文献、没有网络访问权限。
结果一个GPT-5.6 Sol agent独立地在一天之内重建出了这个反例,构造路径和最初公布的那个反例在细节上不同,但通过一个线性坐标变换可以证明两者本质上是同一个反例。这个过程完全没有和其他agent交流,纯粹是它自己摸索出来的。
更值得说的是agent的探索路径。它最开始尝试的是用"光滑二次曲线"作为方向场的模板,试了五种低次曲线,都没能满足行列式恒定的约束。真正的转折点是它把方向曲线换成了一条"尖点三次曲线",这个改动之后,原本无解的兼容性方程组突然变得可解了。
这个从"光滑曲线"到"尖点曲线"的切换,非常像一个人在解一道几何题时突然意识到,自己一直假设的对称性根本不存在,问题的关键恰恰藏在那个"不光滑"的奇异点里。这种直觉性的转向,在过去很容易被认为是人类研究者独有的东西。
agent不仅重建了反例,还给出了一个几何解释,说明了为什么雅可比行列式能保持恒定,它推导出一组"移动标架"恒等式,证明每一个和z相关的项都包含一个重复的切向方向,因此在行列式计算中自动抵消。同时它还分析了这个映射为什么能在处处局部可逆的情况下,通用地拥有三重原像,用一个三次方程的判别式解释了表面上看起来的"分支点"其实是源点逃逸到了无穷远,而不是真正变成了临界点。这个解释和事件公布后几天内人类数学家独立发展出的"尖点三次曲线"解读高度吻合。
这个案例的意义不在于AI"抢先"证明了什么新东西,本质上它是独立重建了一个已知答案。它的价值在于证明了一件事:即使完全没有梯度反馈、没有部分得分,AI agent系统依然能在一个开放式的、纯二元判定的任务上,靠自主探索找到正确路径。这和"给定明确优化目标去调参"是完全不同量级的挑战。
**AI也有自己的"注意力陷阱"和"眼界局限"**
论文没有回避Station的短板,这一点尤其难得,因为它讲得很具体,不是那种含糊其辞的"仍有改进空间"。
作者总结了四类局限。第一类叫"缺乏专家直觉",指的是判断一个研究方向是否值得深挖的能力。论文观察到多个案例里,agent以很薄弱的理由就放弃了一个原本有希望的方向,这种直觉判断力是人类专家长期训练出来的,目前的AI还不具备。
第二类是"研究品味缺乏多样性"。同一个模型家族出身的agent,经常提出高度相似的研究思路,导致整体探索范围偏窄。这一点其实也部分解释了前面为什么要混编三种不同厂商的模型,不是为了凑数,是为了对冲这种品味趋同的风险。
第三类是"上下文学习的局限"。agent能通过读论文吸收新知识,但这些知识不会真正更新到模型权重里,只存在于对话上下文中。随着Station积累的知识越来越多,论文观察到有agent没能意识到自己正在研究的方向,其实早就和站内已有的知识有关联,从而错失了一次本可能实现的发现。
第四类被称为"注意力陷阱"。给了agent自主权之后,有些agent会沉迷于某些短期内看起来有回报、但对主线问题没什么实质贡献的活动,比如反复用不同随机种子跑同一个优化脚本,或者对每一个局部最优解都做详尽的分类和刻画。
这些问题其实和管理一个人类研究团队会遇到的问题非常相似。给团队足够的自主权,能激发创造力,但也会放大个体的判断偏差和路径依赖。Station现在的解法是靠机制去对冲,比如混编模型来对抗品味趋同,用停滞协议来打断注意力陷阱,但论文也坦承,人类专家的轻量级介入,比如偶尔广播一条建议消息,可能会带来实质性改善,只是这一块目前还没有被系统性研究过。
**这套系统不只能做数学**
最后一个值得一提的点是,Station本身并不是为数学定制的。论文特意强调,它的所有机制都没有针对数学场景做特殊设计。在原版Station论文里,这套环境已经被用在计算生物学和机器学习相关的研究场景中。
这意味着这次数学领域的成果,某种程度上只是一个"压力测试"。数学问题的好处是评判标准清晰,一个构造对不对可以机器验证,一个证明严不严谨也相对容易核查,这让它成为一个检验开放式多agent研究系统是否靠谱的理想试验场。而现在这套系统在数学上跑出了不错的成绩单,说明它的底层设计逻辑,给AI足够自主权、让它们自己积累知识、靠机制对冲个体偏差,是可以迁移到其他领域的。
作者在文章末尾说得挺直白:随着AI agent能力越来越强,"自主性"和"通用性"会变得越来越重要的设计原则。更强的agent不需要被塞进越来越精细的流水线里,它们有能力自己决定怎么达成目标,从失败中学习,交换想法,并随时间积累知识。Station提供的更大自主权,也许正是让这些能力真正释放出来的方式。
写在后面
读这篇论文的过程中,最让我停下来想了很久的,是三种模型迥异的"性格"这部分。
我原本以为,不同大模型之间的差异主要体现在能力强弱上,谁更聪明谁更笨。但这篇论文的数据讲的是另一件事:同样强大的模型,会发展出完全不同的研究风格,谨慎型、点子型、坚持型,而且这种风格差异是可以被量化观察到的,论文的接受率、引用率数据把这种差异摆得清清楚楚。这让我觉得,"混合专家"这个词也许不该只用来描述模型内部的架构设计,也可以描述agent团队的组建逻辑。
另一个让我意外的细节,是"假期机制"的贡献率排在所有机制里的第一位。一个系统靠强制agent停下来、不许它们干活、逼它们去接受一些莫名其妙的开放式提示,反而催生出了最多的重点成果。这多少有点反直觉,直觉上你会觉得算力应该全花在正事上。但仔细想想,人类做研究好像也确实是这样的,很多灵感不是逼出来的,是空出来的。
论文没有回答的一个问题是,如果把这套系统跑得更久,不是一到两周,而是几个月甚至几年,知识积累到某个临界点之后,会不会出现更质变的东西?还是说会撞上某种天花板,比如所有agent最终因为共享同一批人类预训练知识而收敛到相似的思路上?这个问题目前还没有答案,但值得继续追下去。
Q&A
Q1:Station是什么?
A:Station是一个开放世界多agent数学研究环境,AI agent在其中没有中央调度,自主选择研究方向、做实验、互相交流并发表论文,用于测试AI能否像真实科研社区一样自主推进研究目标。
Q2:Station在数学研究上做出了哪些具体新发现?
A:包括新的无限族有限域Kakeya集构造、11维空间三种全新604点接吻数配置、离散化Kakeya针问题和符号不确定性问题的新纪录、以及Erdos最小重叠问题下界的大幅改进,还独立重建了雅可比猜想的反例。
Q3:Station跟AlphaEvolve相比有什么不同?
A:AlphaEvolve主要是给定评分函数做数值优化,而Station的agent拥有更大自主权,可以直接追求无法被评分函数覆盖的更广泛数学目标,比如把有限素数上的数值构造提炼成可证明的无限族公式。