
← 跨国串门儿计划vor 4 Tagen · 1 Std. 30 Min.
#718. RSI:人工智能研究人员就当前范式能走多远展开辩论
📝 本期播客简介
本期我们克隆了:Dwarkesh Podcast · AI researchers debate how close we are to recursive self-improvement
原内容更新时间:Fri, 11 Sep 2026
Dwarkesh Patel 邀请 Xyphra 的 CTO Beren Millidge、Thinking Machines 的首席科学家 John Schulman,以及 Base10 的模型训练负责人 Charlie O’Neill,讨论 AI 距离递归自我改进(RSI)还有多远。三位嘉宾都来自相对开放的 AI 实验室和公司,因此对强化学习、模型训练、部署数据与 AI 研究自动化展开了大量具体讨论。
本期的核心分歧,不是 AI 能否继续变强,而是它能否泛化到自己提出正确目标、设计有效实验,并在很长时间跨度内持续修正认知。嘉宾讨论了 sim-to-real(从仿真到真实世界的迁移)、持续学习、蒸馏、RLVR、数据瓶颈与强化学习的真实作用,也追问了为什么模型在基准测试中越来越强,却仍可能在现实世界的复杂任务上受限。
节目后半段进入未来预测:从能独立完成一个月白领工作的远程员工,到在所有电脑可完成的认知工作上压制人类顶尖专家,再到 AI 研究自动化是否等同于 ASI 完全。相比具体时间线,更值得关注的是三位研究者对“人类最后的工作是什么”以及“真正的智能爆炸会卡在哪里”的不同判断。
👤 本期嘉宾
Beren Millidge 是 Xyphra 的 CTO,所在团队正在开发开源模型。他重点讨论了强化学习为何比预期更有效、mid-training 如何为 RL 做准备、模型的熵坍塌与时间跨度泛化,以及持续学习面临的可塑性和灾难性遗忘问题。
John Schulman 是 Thinking Machines 的首席科学家,曾任 OpenAI 联合创始人,并带队开展 ChatGPT 背后的 RLHF(基于人类反馈的强化学习)研究。他从一线研究经验出发,解释了下一个 token 预测为何意外地成为有效目标,也讨论了 AI 研究自动化、目标定义与对齐之间的关系。
Charlie O’Neill 是 Base10 的模型训练负责人,参与讨论模型蒸馏、部署数据、在线学习、环境设计和强化学习训练。他尤其强调真实世界任务与刷榜分布之间的差异,以及模型要成为可靠远程员工,关键取决于在线学习和长时间跨度任务的解决速度。
⏱️ 时间戳
00:31 2036年仍未起飞的原因