
← Andrej Karpathy的RSS订阅清单3 days ago · 8 min
研究者:「AI进步的大头,其实是数据」—12倍效率证据
研究者:「AI进步的大头,其实是数据」—12倍效率证据
过去六年,AI 的突破常被归因于更先进的架构与训练技巧。但一组覆盖 2019—2025 年模型配方和数据语料的交叉训练实验显示:在相同算力预算下,数据端带来的训练效率提升达到 12 倍,模型端仅为 3.7 倍。
本期「Andrej Karpathy的RSS订阅清单」深度解析这项证据及其含义:模型创新并非不重要,而是更多在解决规模化训练的稳定性与可行性;真正推动预训练效率跃迁的主引擎,可能是数据的获取、筛选与策展能力。
原文链接:
https://www.dwarkesh.com/p/pretraining-progress-is-mostly-data
原文标题:Pretraining progress is mostly coming from data
主要内容:
• 跨年份交叉实验表明,数据带来的效率增益约为 12 倍,显著高于模型端的 3.7 倍。
• 模型配方与数据语料的收益大体可叠加,简单相加即可解释 88% 的评测差异。
• 架构、优化器与系统创新的核心价值,往往是让更大规模、更长训练和更庞大集群成为可能。
• 数据质量与规模不存在脱离训练尺度的绝对优劣:小模型偏好严筛数据,大模型则可能更受益于更大、更多样的语料。
• 当公开人类文本接近“数据墙”,自动化数据搜索、验证与策展或将成为下一阶段 AI 进步的重要战场。
推荐理由: