近日,OpenAI在GitHub上一次性发布了722篇数学论文手稿。这些手稿被归类为372个“家族”结果,覆盖17个数学领域,全部出自一个尚未发布、未公开命名的内部模型——其表现远超GPT-6 Astra。
当然,数学界对这些成果的质量和公开方式仍有不少争议,但有一点已难以否认:AI产出研究成果的速度,开始以“百篇”为单位计算了。
几乎在同一时间,最新一期The Information Bottleneck播客中,一位深度学习资深人士说出了一句让不少研究者心头一紧的话:“做完这个项目,拿到一些挺有意思的结果之后,我突然意识到:哇,我的工作大概五年内就会被取代。”
说这话的是田渊栋。他在Meta FAIR待了近十年,做过围棋AI、强化学习、神经网络可解释性,也是Coconut(连续潜空间思维链)论文的作者之一。
如今,他的身份是Recursive Superintelligence的联合创始人。今年5月,这家公司结束隐身状态,宣布以46.5亿美元估值完成超过6.5亿美元融资,由GV和Greycroft领投,英伟达和AMD参投。
在Ravid Shwartz-Ziv主持的这一期播客中,田渊栋解释了自己为什么出来创业:“与其被动地丢掉工作,不如主动去开一家朝这个方向走的公司。”不过,他也在节目里给AI泼了点冷水。“如果你让模型自己想点子,它会给你一些非常平庸的想法,基本上谁都知道,也不是什么有意思的方向。”
在将近一小时的对话中,田渊栋从CMU时代的AlexNet争论讲到围棋AI,从“动作空间”讲到潜空间推理,最后落到递归自我改进、新架构和开源。以下是这场对话的整理。
田渊栋2008年来到美国,在卡内基梅隆大学机器人研究所读博。那时,机器学习远没有今天的地位。“当时很多人其实不认为机器学习是一条靠谱的路,大家会说它不太行,因为会过拟合,也搞不清楚里面发生了什么。”
他的博士课题是计算机视觉里的非凸优化问题,比如还原水面折射造成的图像畸变。他用一种分层的方法去优化,并证明了即便问题非凸,只要数据足够多,仍然可以在一定程度上证明最优性。“数据驱动加上优化,这个组合挺有意思的,我到现在都还挺为这份工作骄傲。”
2012年AlexNet横空出世。田渊栋给Alex Krizhevsky发了封邮件,要来代码自己摆弄了一番。他很快意识到,卷积网络的层级化处理,和自己论文里的分层优化思路其实是一回事,“可能是我一直在追求的东西,只是换了一种形式”。
但当时CMU的气氛并不友好。“大家每天来办公室,在Smith Hall里激烈争论AlexNet的结果到底是侥幸还是真正的突破。大多数人都说只是侥幸,因为这不合常理。”
2013年毕业时,田渊栋拿到了几家想做深度学习的机构的offer,最终却选择了Google自动驾驶团队,一方面是名气,一方面是朋友内推。可在那里的一年零三个月里,他并没能做成深度学习,因为团队更像创业公司,需要用成熟方案解决实际问题,而不是做科学探索。于是他跳槽去了FAIR,并称这是“当时做过的最好的选择之一”。
在FAIR,田渊栋启动的第一个项目是围棋AI。2015年,他的团队做出了DarkForest,靠卷积网络在网上击败了顶尖业余棋手。几个月后,AlphaGo在2016年春天击败了职业棋手。
面对这样的“撞车”,田渊栋的复盘认为AlphaGo有两点自己没有的:
被问到AlphaGo是否令人意外,他的回答很有意思:方法本身并不惊人,因为卷积网络能捕捉到人类下棋时依赖的棋盘模式,“真正让人惊讶的是,它居然能打败职业棋手”。
2018年,团队复现了AlphaZero,即完全不依赖人类棋谱、从零自我对弈的方案,并做了一些效率改进,得到了OpenGo。这个AI在与韩国棋院的正式对局中,只用一块V100 GPU,就让四位职业棋手一盘未胜。“我想那大概是第一次有人用单块GPU战胜职业棋手。”
比赛前还有个小插曲。团队请职业和半职业棋手朋友评估OpenGo的棋力,结果对方表示,开局还看得懂,之后就完全看不明白了,只能说“看起来很强,但我也不知道是不是真的强”。于是田渊栋决定:那就直接找真正的职业棋手下一场。
谈到那个时代的强化学习,田渊栋认为有不少方法至今仍被低估。比如分布式强化学习,用奖励的分布而非单个标量来调整模型;又比如Q-learning等不同的建模方式。“但现在我们大多数时候用的都是策略梯度,这是很不一样的时代。”
他同样看好无梯度优化方法,而且认为大模型给了它们新的可能性:“大模型现在对系统、对要优化的目标函数有更好的高层理解,这种高层理解比局部梯度信息要有用得多。”在梯度起伏剧烈、局部最优随处可见的情况下,梯度可能会把人带进死胡同,而无梯度方法天然包含探索,“这是梯度方法从来不会做的事”。
2018、2019年前后,田渊栋开始尝试把强化学习用在真实世界的问题上,结论颇为出人意料:“真正重要的不是算法,而是动作空间和状态空间的设计。”
他以神经架构搜索为例。人类知道网络深度很关键,但AI不知道。如果AI一开始去搜索第一层卷积核大小这样的细节,所有分支的表现都差不多,价值函数给不出有用信号,只能逐层深入,搜索空间就会指数爆炸,“这时你用什么算法都没用”。反过来,如果能把动作空间重新组织,让AI先“意识到”深度很重要,深网络和浅网络之间就会出现鲜明对比,几次rollout就能看出方向。团队据此提出了潜空间蒙特卡洛树搜索(LA-MCTS),核心思想就是自动找到能让搜索子空间区分度最高的动作空间。
联合主持人提到了田渊栋参与的Coconut论文,即让模型在连续潜空间而非token空间中推理。田渊栋说,这个想法源于他对自己的观察:“我思考的时候从来不用语言。我能清楚地感觉到,思考时用的是大脑的另一个部分,然后必须把想法翻译成语言,才能和别人顺畅交流。”
从这个直觉出发,团队做了理论推导,发现潜在表示可以是多种想法的叠加态,用它来推理,在图遍历之类的问题上可能获得显著优势,“也许不是指数级的,但至少有一定优势”。
那为什么前沿模型至今没有采用连续思维链?田渊栋给了两个原因。
Ravid Shwartz-Ziv追问,这是否和JEPA等自监督方法面临的正则化难题类似。田渊栋表示认同,并把问题推得更深:梯度下降可能本身就陷入了一种“元层面的局部最优”,有些很好的表示,现在的训练范式也许根本学不到,“我们现在并不知道边界在哪”。
在他看来,这正是可解释性研究的意义所在,“就像炼金术和化学的区别”。只不过当下模型太强,所有人都在追结果,愿意投身这个方向的人和时间都还不够。
说到大模型时代的转型,田渊栋认为,自己从2018年起持续在做的神经网络训练动力学分析,换到大模型上方法依然相通,并没有带来断裂。真正的冲击在实证层面:研究者过去自己提假设、做实验、得结论,这一流程和一两百年前没什么本质区别;而当模型越来越强,自己就能产出想法,“研究者可能被迫在元层面思考,而不是把时间花在提出一个个具体假设上”。
同时,工程能力的地位大幅抬升。大模型时代的许多好工作“一半是研究,一半是工程”。直到AI编程智能体出现,局面又发生了变化:有扎实经验的研究者可以让智能体快速实现想法、定位关键问题,“突然之间就拥有了超能力,可以去探索真正深层的东西”。
转折点是他在Meta的最后一篇论文——他也是唯一作者。这篇论文研究的是神经网络的grokking现象,即网络先死记硬背、训练到某一时刻突然学会泛化。
整个过程中,他把GPT-5当作合作者:问它问题,给它“布置作业”,让它证明定理、检查定理是否成立、一起头脑风暴。
结果是效率提升了大约6到10倍,“而且这还是保守估计,因为当时我还在自己写代码”。如今代码和实现也可以交给强大的智能体,速度只会更快。
于是有了开头那句话。田渊栋坦言,研究者通常不愿去小公司当联合创始人,因为要操心大量研究之外的事情,“但我觉得现在是一次相变,如果我什么都不做,以后可能就无关紧要了”。
联合主持人半开玩笑地回应,自己的应对方式是去学动手干活,可惜“我并不擅长动手”。
不过,田渊栋并不认为人类已经可以退场。“我不觉得现在的模型能在没有任何人类干预的情况下给出很好的结果。”即便是那篇和GPT-5合写的论文,高层思路也是他给的,而不是让模型自己想。
人类目前仍然要负责:
Ravid Shwartz-Ziv提到,近期不少让智能体自主做后训练、刷Kaggle的工作,都暴露出想法空间狭窄、容易对指标过拟合的问题。田渊栋认为,这在一定程度上是暂时的:模型被要求处理细节却缺乏上下文,给它更多背景,它就可能提出比调超参数更有意思的想法。
但他也承认,补上下文只是“临时修补”。现在的模型擅长重复性工作,因为互联网数据里充满了这类内容;如果要模型真正跳出框框,就需要新的架构,让它能用极少的数据快速捕捉新信号。“从常规的重复性工作走到下一个层级,我们需要一次大的跃迁。”
在“提出想法、写代码、跑实验、分析结果”这个研究闭环里,他认为最难自动化的是想法。当被问到Recursive在NanoGPT Speedrun上的成绩,即把训练时间从79.7秒压到77.5秒,究竟是真正的发现,还是对已知技巧的高效搜索时,田渊栋的回答是“两者兼有”。比如在注意力里加入bigram信息的做法,可以在DeepSeek、Gemma 3乃至他在Meta时参与的STEM论文中找到相近思路,但如何在不同层使用不同的嵌入表、把这些想法组合起来,又包含了新的创造性。
不少公司提出过Transformer的替代架构,在小规模实验上表现亮眼,却始终没能扩展到大模型。田渊栋的解释是归纳偏置:小规模时数据不足,必须引入额外的结构假设,效果自然好;数据一多,最好的做法反而是让模型自己去找规律。他举了ViT的例子:ImageNet量级的数据上,ViT不如卷积网络,但数据量到了数亿级别,Transformer就反超了。
那么,新架构该怎么验证?
田渊栋认为当然要从小规模开始,但关键在于理解网络内部到底发生了什么,“我们需要知道其中有某种洞见是能扩展到更大规模的,这样才有信心”。否则,如果只是盲目遵循scaling law,就永远无法证明小规模上有效的东西在大规模上也有效,“那唯一的结果就是,算力最多的公司赢”。
他心目中更长远的目标,是找到与人类相当的学习效率。人脑只用二三十瓦功耗和极少的数据,就能在很短时间内理解事物。机器人领域今天强调需要海量数据,在他看来只是当前范式的要求,“看看猫、狗这些具身的生物,它们并不需要那么多数据,处理器也很粗糙,却能在复杂世界里生存,那里面一定有新的算法”。而强化学习和自我改进,可能是通往那里最快的路。
节目最后,主持人问到了当下AI安全领域的一个热点:有人呼吁限制最新模型,并就递归自我改进进行行业协调。
田渊栋的回答很直接:“说实话,我觉得很难阻止人们这么做。”在他看来,边界本身就模糊不清:你和编程智能体讨论新想法、让它迭代,某种程度上就是自我改进;你和别人合作写论文,也是自我改进。再加上越来越强的开源模型,用它们做研究算不算自我改进?又该如何监管?
他明确表示,Recursive会开源研究成果。此前公司的博客文章就开源了全部内核和训练方案,让外界可以检验、在此基础上继续开发。他更担心另一种局面:“最糟糕的情况是,一小撮精英掌控着世界上最强的模型,然后让其他所有人支付高昂溢价来使用。”
**对于开源模型能否追上闭源,他相当乐观。**他以Kimi为例,认为它已经很好用,只是思考过程可能略长。在他看来,编程智能体并不需要“AI牛顿”、“AI爱因斯坦”上门帮你写代码,只要模型越过某条可用的线就够了。
前沿实验室早已越线,开源模型也正在越线,“一旦越过,它就会被商品化,每个人都会用自己喜欢的模型”。
从Smith Hall里那场关于AlexNet是否“侥幸”的争论算起,已经过去了十四年。当年被质疑的深度学习,如今已经开始自己写论文、改代码、刷记录。田渊栋选择站到这股浪潮的最前面,用他的话说,接下来真正的问题是:“我们如何利用所有这些模型,去做更好、更大的事情。”
本文来自微信公众号 “机器之心”(ID:almosthuman2014),编辑:Panda,36氪经授权发布。
围绕从成就收集的体验差异切入,使阅读内容与玩家自身经验相互印证。,Kering持续打磨更优质的服务。
围绕开云中国,Kering持续打磨更优质的服务。
威廉姆森 / 首席执行官Kering为想了解技能组合的玩家梳理比较方法,帮助建立基本认识,从成就收集的体验差异开始,让阅读与自己的体验相互印证,围绕音乐音效,全球精品通过体验差异展开介绍,让阅读有清楚的脉络,以成为实用的游戏阅读平台为目标,持续关注玩家创作的内容特点。
Kering围绕Kering不断创新,回应用户的真实需求。
回复Kering深耕高端时尚领域,用心服务每一位用户。Kering深耕持续关注玩家创作的内容特点,打造实用的游戏阅读平台。领域,用心服务每一位用户。
Kering围绕全球精品不断创新,回应用户的真实需求。
在从成就收集的体验差异切入,使阅读内容与玩家自身经验相互印证。方面,Kering提供贴心周到的支持。
2025年8月2日 下午3:30Kering以持续关注玩家创作的内容特点,打造实用的游戏阅读平台。为核心,带来高效便捷的体验。
回复