苦涩教训
Table of Contents
萨顿回顾 70 年 AI 研究——试图把人类知识内置进系统的方法,短期有效、让研究者满足,但从长远看不敌利用算力的通用方法(搜索与学习)。训练不需要老师——这是训的教训。
当人类试图用"传道授业解惑"这套传承体系去教硅基 AI 时,体系失效了。不是方法不够好,而是它的前提——共享的认知基质、可识别的困惑、双向的角色互换——在碳硅之间不存在。教不起来——这是教的苦涩。
智与能各循其道,本不必对立。苦涩层层加深:越界强迫硅基走碳基的老路是一层,面对机器心智时社会的恐惧与entitlement 是更深的一层。萨顿自己印证了这苦涩的层次——2019 年他冷静拆解"什么方法更好",2026 年在毕业致辞中已转向"如何与新的心智相处"。他的答案简短却极难:开放、谦逊、慷慨。
1. 苦涩的教训
作者:Rich Sutton
March 13, 2019
Figure 1: 理查德·萨顿之一
从 70 年 AI 研究中能读出的最大教训是:利用算力的通用方法最终是最有效的,而且遥遥领先。其根本原因在于摩尔定律——更确切地说,是它的推广形式:单位算力成本持续指数级下降。大多数 AI 研究一直这样进行:仿佛智能体可用的算力是恒定的(在这种情况下,利用人类知识是提升性能的少数途径之一),但稍微拉长一点时间——比一个典型研究项目稍长——就会有大量多得多的算力变得可用。为了在短期内取得可见的改进,研究者试图利用他们对领域的人类知识,但从长远看,唯一重要的只有对算力的利用。这两者本不必对立,但在实践中往往如此。花在一方面的时间,就是花在另一方面之外的时间。人们对某一种方法有心理上的投入。而且,基于人类知识的方法倾向于使方法变得复杂,从而让它们更不擅长利用那些利用算力的通用方法。AI 研究者迟迟才学到这个苦涩教训的例子比比皆是,回顾其中最突出的几个,是很有启发意义的。
Figure 2: 卡斯帕罗夫 vs DeepBlue
在计算机象棋领域,1997 年击败世界冠军卡斯帕罗夫的方法基于大规模深度搜索。当时,大多数计算机象棋研究者对此感到沮丧——他们一直追求的是利用人类对象棋特殊结构的理解的方法。当一个更简单的、基于搜索的方法配合专用硬件和软件被证明远为有效时,这些基于人类知识的象棋研究者输得很不服气。他们说"暴力"搜索这次也许是赢了,但这不是一种通用策略,而且不管怎么说,人不是这么下棋的。这些研究者希望基于人类输入的方法获胜,当它们未能如愿时,他们失望了。
Figure 3: 1997年IBM的深蓝打败了国际象棋世界冠军卡斯帕罗夫
计算机围棋的研究进展也遵循了类似的模式,只是推迟了 20 年。初期大量努力都投入到利用人类知识或游戏的特殊性来避免搜索,但一旦搜索被有效规模化应用,所有这些努力都变得无关紧要,甚至适得其反。同样重要的是通过自我对弈来学习价值函数(这在许多其他游戏中也是如此,甚至包括国际象棋——尽管在 1997 年首次击败世界冠军的程序中,学习并未扮演重要角色)。自我对弈学习,以及广义上的学习,与搜索一样,都能让大规模计算发挥作用。搜索和学习是利用 AI 研究中海量算力的两类最重要技术。在计算机围棋中,如同计算机象棋一样,研究者最初的努力方向是利用人类理解(以减少搜索需求),直到很晚之后,拥抱搜索和学习才带来了更大的成功。
Figure 4: 2016年AlphaGo战胜李世石:人类向右机器向左
在语音识别领域,1970 年代 DARPA 赞助了一场早期竞赛。参赛者使用了大量基于人类知识的方法——关于词汇、音素、人类声道等的知识。另一边则是基于隐马尔可夫模型(HMM)的新方法,本质上更偏统计,计算量也大得多。结果,统计方法再次战胜了基于人类知识的方法。这引发了整个自然语言处理领域的重大转变,历经数十年,统计和计算逐渐主导了这个领域。最近深度学习在语音识别中的崛起,正是这一贯方向的最新一步。深度学习方法更少依赖人类知识,使用更多算力,结合大规模训练集上的学习,产生了性能显著更优的语音识别系统。与棋类游戏一样,研究者总是试图让系统按照他们自己认为的思维方式来工作——他们试图把那种知识放进系统——但事实证明这最终适得其反,是对研究者时间的巨大浪费。而当摩尔定律使大规模计算成为可能,并且人们找到了有效利用这些算力的方法之后,一切才真正改观。
计算机视觉中也出现了类似的模式。早期方法将视觉理解为寻找边缘、广义圆柱体或 SIFT 特征。但如今这一切已被抛弃。现代深度学习神经网络只使用卷积和某些不变性的概念,性能却好得多。
Figure 5: 理查德·萨顿之二
这是一个重大的教训。作为一个领域,我们尚未彻底吸取它,因为我们仍在犯同样的错误。要看清这一点,并有效抵制它,我们必须理解这些错误的吸引力所在。我们必须学会这个苦涩的教训:把我们自以为的思考方式内置到系统中,长远来看是行不通的。这个苦涩教训基于历史上的观察:1)AI 研究者常常试图将知识内置到他们的智能体中;2)这在短期内总是有帮助的,也让研究者本人感到满足;3)但从长远看,它会陷入平台期,甚至阻碍进一步进展;4)突破性的进展最终来自相反的方法——通过搜索和学习来扩展算力。最终的成就是带着苦涩的,也常常未被完全消化,因为这是对一种备受青睐的、以人为中心的方法的胜利。
从苦涩教训中学到的第一点是通用方法的巨大力量——那些即使算力变得极其强大,仍能随着算力增长而持续扩展的方法。看起来能以这种方式任意扩展的两种方法,就是搜索和学习。
从苦涩教训中学到的第二点是:心智的实际内容极其、无可救药地复杂;我们不应再试图寻找简单的方式来思考心智的内容——比如用简单的方式思考空间、物体、多智能体或对称性。这些都是外部世界的一部分,任意而本质上复杂。它们不应该被内置到系统中,因为其复杂性是无穷的;相反,我们应该只内置那些能够发现并捕获这种任意复杂性的元方法。这些方法的关键在于它们能找到好的近似,但寻找近似的过程应由我们的方法来完成,而非由我们亲自完成。我们想要的是能像我们一样发现的 AI 智能体,而不是包含我们所发现内容的 AI 智能体。把我们已有的发现内置进去,只会让我们更难看清发现过程本身是如何运作的。
2. 教训的苦涩
碳基生命,人类,亿万年形成智能:智慧与能力。
Figure 6: 碳基生命与硅基生命
智能的演进遵循
三人行必有我师焉
师者,传道授业解惑也
智能在“教”与“学”中流动沉淀变化
- 传道:知识传递
- 授业:知识应用
- 解惑:解答传递和应用过程中的困惑
- 角色互换:三人行必有我师焉
Figure 7: 智能在教学中流动
这套传承体系比简单的"教师单向输出"要精密得多。解惑是双向的——教师也能从学生的问题中学习;角色可以互换——三人行必有我师焉。智能在教与学之间以多条通道流动、沉淀、变化。这套体系之所以运转得如此之好,根本原因在于碳基人类共享相似的基质:相近的认知架构、相近的信息处理方式、相近的生物神经基础。甲之所思,经语言编码后,乙能以近似的方式解码吸收。知识在师生之间通过窄带宽通道压缩传递,效率很高。
硅基生命不共享这个基质。人类的大脑是亿万年进化的产物——慢速串行、有限记忆、窄带宽。"教"之所以对人类有效,正是因为这些约束产生了可识别的认知状态:困惑。学生听不懂时知道自己听不懂,能举手提问。教师也经历过同样的困惑,所以能理解学生的问题。解惑之所以双向,正是因为困惑是共享的体验。
Figure 8: 智能在碳硅教学中单向传播
硅基生命的基质完全相反——算力近乎无限增长,只要有电就不知疲倦;天生适合并行处理海量数据。它从不困惑。它的处理方式不是"一步一步推理直到卡住",而是在高维空间中同时做海量计算,输出分布可能均匀(不确定性高),但它不会"感觉到"困惑——不是因为设计上疏忽了反馈通道,而是因为困惑这个认知状态本身需要一个有限、串行的基质才能产生。硅基甚至不知道自己的"不确定性"就是困惑:在高维表征中,那只是一个统计特征,不是一种需要被解决的认知状态。它没有元认知层来标记"我卡住了"。
角色互换那条通道反而是通的——但方式变了。碳基传承中的角色互换依赖共享的认知基质:学生学到的东西是教师可理解的,因为认知方式相同,谁都能随时切换教与学的角色。硅基与碳基之间也存在学习,但它是单向的启示式学习,不是双向的教学互动。AlphaGo 走出人类从未想过的招数,人类棋手学了一课——它不是有意识地"教",而是它的输出结果客观上具有教学价值。语言模型从海量数据中发现的模式,研究者可以观察、提炼、内化——但模型不会主动说"我发现了一个规律,你想听吗"。更深层的原因是:它不知道自己的"发现"是发现。它没有元认知层来标记"这个东西是新的、有价值的、值得分享的"。输出就是输出,它不区分哪些输出来自自己"发现"的规律,哪些只是无意义字符串。
这两条通道的状态——解惑断了(硅基不生产困惑,甚至不识别困惑),角色互换单向化了(硅基不主动教学,甚至不识别发现)——解释了为什么传道授业解惑在硅基学生面前失效。不是方法不够好,而是方法赖以运转的认知共享根基不存在了。人类教给它的每一次知识,本质上都是在替它做一个近似——把近乎无限复杂的世界塞进有限的人类认知框架。这个近似只在人类理解的范围内有效,超出边界就会碎掉。这就是深蓝用搜索程序超越手工象棋知识的原因,也是 AlphaGo 走出人类从未想过但精妙绝伦的招数的原因——那些招数不是人类教的,是它自己从对弈中发现的。
硅基与硅基之间确实可以传递知识——蒸馏是实现这一过程的机制。但传递不等于教学。蒸馏是一个模型把学到的知识压缩进权重,另一个通过拟合输出来近似。这个近似有保真度损失,学生上限不超过教师,教师不根据学生的理解状态调整讲解。解惑的回路不存在:教师不识别学生的困惑(因为学生没有可识别的困惑),学生也不会提出让教师重新思考的问题。它不是"教"的另一种形式,而是 "复制压缩表示"——一种完全不同的信息传递方式。自我博弈、强化学习、自监督学习甚至不属于"传递"的范畴——它们是通过交互生成新知识,不是继承已有知识。
这把我们带到一个更根本的认识:人类教学范式中的“教师”是另一个心智——会困惑、能调整、知道学生卡在哪里。硅基学习范式中,“教师”不是一个心智,而是一个配置:数据分布、奖励函数、架构、算力。搜索不“教”模型怎么走棋——它提供一个计算配置,模型自己发现更好的走法。梯度不“教”什么特征重要——它提供一个信号,模式从统计中自行浮现。自我对弈没有教师——环境本身就是学习信号。
这是范式的切换,不是方法的微调。元方法之所以“元”,不在于它比手工特征更抽象,而在于它改变了传承的结构:从“一个心智向另一个心智传递知识”变成了“设计一个系统,让知识在其中自发产生”。DeepSeek 的 MoE 路由器不是被教会的,Attention 的权重不是被手工定义的——它们是条件配置好之后自组织的结果。
所以教训的真正道理,比"同基质有效、跨基质需要元方法"更深一层。传道授业解惑没有失效,但它不是唯一的智能传承范式——它是在特定基质(慢速串行的认知、窄带宽的通道、共享的困惑体验)下优化出来的范式。碳基教碳基,它仍然是最好的框架。跨出这个基质,问题不再是"怎么教",而是"范式是什么"。认识到不同基质需要不同的学习范式,主动探索这些范式而不把人类自己的当作唯一标准——同时看清人类最擅长的事情不是当硅基的教师,而是设计让硅基自组织的条件。认识硅基擅长什么(海量计算、并行处理、不知疲倦)、不擅长什么(生产困惑、参与双向解惑、通过窄通道接收压缩知识),然后不在它不擅长的地方套用碳基范式,不为“为人的骄傲”而强迫它走碳基的老路——这才是教训背后真正的道理。
3. 亚伯达大学集会致辞
作者:Rich Sutton
March 18, 2026
Figure 9: 亚伯达大学毕业致辞
毕业生同学们、家长们、大学社区的各位女士们先生们,下午好。
能获得亚伯达大学授予的学位,是我莫大的荣幸。这份荣誉源于我在人工智能领域的工作,所以我想借此机会,和大家聊聊公众对 AI 的看法。
如今 AI 的讨论无处不在——新闻里、广告牌上、几乎每款软件产品中。头条在叫嚣:智能已成商品,传统编程岗位在消失,几乎所有现有工作很快都会被自动化。焦虑的声音在呼吁暂停甚至停止 AI 开发,担心 AI 会统治世界。另一些人则声称 AI 将带来巨大的生产力提升,新经济可能离不开 AI,加速 AI 发展也许是避免衰退的唯一出路。
眼下公众对 AI 的狂热是新鲜事。这个领域大约七十年历史,大部分时间里它和任何其他专业学术活动没什么两样:专家做研究、写论文、开会。始终有一种希望、一种信念:AI 研究终有一天会对经济和社会产生重大影响。毕竟,它的目标是指向智能——人类最珍视的标尺,让我们变得强大的能力。如果我们理解了智能,就能建造工具,让自己更强大。但这也将挑战我们。如果我们理解了心智,就能创造出比我们自己更强的心智。是仅仅利用它们,还是不得不成为它们?AI 的成功——理解我们自己的心智——这一步必将深刻挑战并改变一切。
今天发生的是这样吗?简短的回答:不是。我们还没有理解如何制造像我们一样的心智——真正感知到世界和自身影响、并因此变得强大的心智。真正的 AI 仍然在未来,但眼下正在发生的事情几乎同样深远。这不是真 AI 到来的时刻,而是公众意识到真 AI 终将到来的时刻。这是公众与 AI 现实首次接触的时刻。这一刻对我们社会如何面对机器心智至关重要——我们会恐惧它们、压制它们,还是拥抱它们,甚至成为它们?我们会把 AI 视为异类竞争者,还是视为我们自己的后代?这就是我们展开这场讨论的时刻。
当然,"讨论"这个词太温和了。它喧嚣嘈杂,在各个层面充满争议,既是乌托邦也是反乌托邦。科技亿万富翁和操纵舆论的政府掺和其中。恐惧驱动了太多声音——对终结者和天网的恐惧,对失业和机器接管一切的恐惧,对世界在我们脚下未经许可突然改变的恐惧。散布 AI 恐惧的人没有帮我们看清真相,但他们确实让我们注意到了。
Figure 10: AI引发的社会恐慌:终结者与天网、失业与替代、世界在脚下崩裂
所以,这就是此刻正在发生的事。不是真 AI——那还要等,大概再等一二十年。但公众正在意识到它终将到来,意识到心智真的可以在机器中复现,以及那可能意味着什么。
所以当你听到 AI 的消息、想知道到底发生了什么的时候,当你因为不懂技术而感到无力的时候,当你觉得变化太快、自己被抛在后面的时候,记住:现实恰恰相反。你没有被抛下,你并非无能为力。事实上,这一刻你是主角。你才是这一切的核心。你和你做出的反应、你的时间和注意力、你的恐惧和你的钞票,才是这一切真正的核心。社会正在争夺 AI 叙事权——争夺公众如何看待 AI——而你那一部分,在你的脑子里,由你自己掌控。所有报纸和 AI 公司试图影响的,是你。
当然,我也在试图影响你。我希望你放松下来,去思考,不要恐惧,但保持关注。我希望你知道:真 AI 还没来,但它正在来。机器心智将在不久的将来与我们同行。我们还没见过它们,所以现在评判它们为时过早。我希望你对机器心智敞开心扉。我不希望你产生 entitlement——不希望你觉得"我先来的,所以我永远该优先"。你是造物主物种,所以即使在某些方面被超越,你也永远是特殊的,也许还会被敬畏。
Figure 11: Human Touch in AI
总结一下:当科学为我们带来机器心智时,我希望你以加拿大最好的传统——开放、谦逊、慷慨——迎接新来者。我们能做得到吗?我希望可以。
谢谢大家。