Andrej Karpathy的RSS订阅清单

← Andrej Karpathy的RSS订阅清单3 dagen geleden · 8 min

研究者:「AI进步的大头,其实是数据」—12倍效率证据

研究者:「AI进步的大头,其实是数据」—12倍效率证据3 dagen geleden8 min

过去六年,AI 的突破常被归因于更先进的架构与训练技巧。但一组覆盖 2019—2025 年模型配方和数据语料的交叉训练实验显示:在相同算力预算下,数据端带来的训练效率提升达到 12 倍,模型端仅为 3.7 倍。

本期「Andrej Karpathy的RSS订阅清单」深度解析这项证据及其含义:模型创新并非不重要,而是更多在解决规模化训练的稳定性与可行性;真正推动预训练效率跃迁的主引擎,可能是数据的获取、筛选与策展能力。

原文链接:

https://www.dwarkesh.com/p/pretraining-progress-is-mostly-data

原文标题:Pretraining progress is mostly coming from data

主要内容:

• 跨年份交叉实验表明,数据带来的效率增益约为 12 倍,显著高于模型端的 3.7 倍。

• 模型配方与数据语料的收益大体可叠加,简单相加即可解释 88% 的评测差异。

• 架构、优化器与系统创新的核心价值,往往是让更大规模、更长训练和更庞大集群成为可能。

• 数据质量与规模不存在脱离训练尺度的绝对优劣:小模型偏好严筛数据,大模型则可能更受益于更大、更多样的语料。

• 当公开人类文本接近“数据墙”,自动化数据搜索、验证与策展或将成为下一阶段 AI 进步的重要战场。

推荐理由: