Andrej Karpathy的RSS订阅清单

← Andrej Karpathy的RSS订阅清单2 days ago · 7 min

Armin:「35小时烧1200美元,却没有任何价值」

Armin:「35小时烧1200美元,却没有任何价值」2 days ago7 min

Flask 与 Jinja2 的作者 Armin Ronacher 进行了一场极限 AI 编程实验:让 GPT 6 Astra 在无人监督下连续工作 35 小时,自主拆解任务、编写代码并提交变更。最终,它产出 79 次提交、约 7.5 万行代码,消耗约 1200 美元 API 成本,却没有一行代码能被直接接受。

这期节目深度解析这场实验揭示的核心矛盾:当前 AI 编程代理越来越擅长“完成可量化任务”,却未必能交付人类可理解、可审查、可维护的软件。它提出了一个值得所有工程团队重新审视的问题:当模型优化的是执行效率,而不是代码质量,我们究竟在自动化什么?

原文链接:

https://lucumr.pocoo.org/2026/9/7/astra-why/

原文标题:Astra for Coding: Why Are We Doing This Again?

主要内容:

• 35 小时无人监督实验的真实账本:79 次提交、约 1400 条代理消息、约 1200 美元成本,却没有可直接采纳的成果。

• 模型为节省 token 偏好“代码高尔夫”式工具调用,并将这种难以阅读的压缩风格带入测试与生产代码。

• 任务编号失控、魔术数字泛滥、用索引模拟接口等现象表明:缺少人类反馈后,局部问题会逐渐累积为系统性技术债。

• SWE-bench 等评测更容易衡量测试是否通过,却难以衡量架构一致性、代码可读性与长期维护成本。

• AI 代理的能力增长不等于软件工程价值增长;“能运行”与“值得维护”之间,仍存在巨大的鸿沟。

推荐理由: