一场悄然发生的工作流迁移
过去一年,几位资深工程师的日常工作发生了明显变化:OpenAI 研究员 roon 表示自己不再写代码,100% 由 GPT 完成;Claude Code 负责人 Boris Cherny 公开提到两个多月没有手写一行代码,单日合并 27 个 PR;Rails 之父 DHH 也在今年 4 月转向"Agent 优先",基本告别手写代码。
变化不只是个人习惯,而是出现了可以复现的完整案例:DHH 用 Claude 将一个 Python 库完整重写为 Rust,Bun 团队在不到两周内将百万行级别的底层代码从 Zig 迁移到 Rust。这些实践为"AI 究竟能在编码中承担多少"提供了一个可参照的标尺。
真实案例:一次重写是怎么完成的
项目与目标
被重写的对象是 TerminalTextEffects(TTE),一款终端文字特效引擎,既可作为命令行程序运行,也可作为 Python 库被引用。开发者可以用它控制文字轨迹、颜色、渐变和动画分镜。
DHH 的目标是用 Rust 重写整个库,并最终产出一个独立的可执行文件。
执行过程
- 工具:全程使用 Claude Fable 5,模型一次性接收任务后自主推进。
- 资源消耗:约 1100 万 Token,整个过程 3 小时 11 分。
- 并行方式:8 个 Agent 各占一个分支同时开工,分别负责阅读原代码、生成实现、编译、跑测试、修复失败,再分批合并。
- 人工介入:只在最开始让 Claude 制定计划,之后全程 0 干预,没有套用预设工作流。
结果对比
- 代码体量:Rust 版本 2.1 万行,与 Python 原版几乎一致。
- 产物形态:原本需要 Python 运行环境的项目,最终变成仅 3MB 的独立可执行文件。
- 性能提升:启动时间从 87 毫秒压缩到 2 毫秒,渲染速度提升约 9.6 倍。
- 效果数量:可运行 37 种特效。
对照组
同样的任务交给 Codex,结果同样可用,但速度慢约 30%,单次任务成本 43 美元。这一对照说明,主流编码 Agent 在结果质量上已较接近,差异更多体现在效率与成本上。
用户价值:AI 编码真正解决的是什么
1. 跨语言迁移的体力活
TTE 重写、Zig 到 Rust 的迁移,核心难点不是算法,而是"把已有逻辑逐行翻译成新语言"。这类任务规则明确、边界清晰,正好匹配当前 Agent 的能力模型。
2. 体量可控项目的快速重制
TTE 案例中,Rust 主代码 2.1 万行,对 Agent 来说是可以一次性吞下的规模。Bun 案例则将这个尺度推到百万行级别,但用了更多时间与并行策略。
3. 性能优化与产物精简
重写后启动时间压缩 40 多倍,渲染提升近 10 倍,产物从依赖运行时变成 3MB 单文件。这些是传统手写代码也常追求的目标,但 AI 把完成时间从"数周"压缩到"数小时"。
4. 释放开发者的注意力
DHH 提到,过去让他反复卡住的不是思路本身,而是一行 Bash 条件语句的手写动作。Agent 把这类细碎执行自动化后,开发者可以把精力放在更前置的判断上。
适用场景:哪些任务适合交给 AI
根据上述案例可以归纳出几类适合 AI 主导编码的场景:
- 已有项目的跨语言重写:逻辑已经验证过,目标是换实现语言或换运行时。
- 工具类与库类项目:边界明确,输入输出契约清晰,失败模式可枚举。
- 性能与体积敏感的产物:当目标是降低启动时间、压缩包体积时,AI 重写常常能直接给出可量化的结果。
- 代码量可控、单元可拆分的重构:可以按模块分给多个 Agent 并行处理,再合并测试。
需要谨慎对待的场景包括:业务规则高度依赖领域知识、错误代价极高的系统(如金融交易、医疗设备),以及需要长期维护但缺乏测试覆盖的存量代码。
选择标准:评估编码 Agent 的几个维度
从 TTE 重写和 Codex 对照中,可以提炼出几个可直接用于选型的维度:
- 完成同一任务的速度差异:同输入下耗时对比,是衡量模型效率最直观的指标。
- 单次任务 Token 与金钱成本:DHH 的 Codex 一次任务 43 美元,Claude 同样任务使用约 1100 万 Token,两者都应纳入预算评估。
- 长上下文任务的一次性通过率:TTE 是一次性给出任务并自主推进的,这种"长链路 one-shot"能力是关键。
- 并行扩展能力:8 个 Agent 各占分支同时开工、再合并结果,决定了能否放大到更大体量项目。
- 可执行产物形态:是源码补丁、独立可执行文件、还是仅 IDE 内的代码补全,直接影响下游交付方式。
- 对人工干预的依赖程度:能在制定计划后保持 0 干预,意味着规划与执行能力的整合更成熟。
落地建议:团队如何开始
第一步:选一个边界清晰的存量项目试点
从内部已有的小型库或工具开始,优先选择已经有测试覆盖的项目。这样既容易量化 AI 的输出质量,也能用回归测试快速判断是否回归。
第二步:明确任务边界与验收标准
在交给 Agent 之前,把"什么算正确"写成可检查的清单:性能指标、产物大小、必须保留的接口、必须覆盖的测试用例。需求越具体,AI 的第一次通过率越高。
第三步:搭建可并行的分支与合并流程
参考 TTE 的做法,让不同 Agent 在独立分支上处理不同模块,再统一合并并跑回归。这样既能放大效率,也方便定位是哪个模块出了问题。
第四步:建立成本与速度的对照记录
同一任务至少跑两个模型,记录 Token 消耗、耗时、最终通过率,作为后续选型的真实数据。Codex 慢 30%、成本 43 美元这种信息,只有在自己环境里复现才有价值。
第五步:把开发者角色重新定义
当"写代码"这一步被 Agent 接管,开发者的工作自然前移到四件事:定义需求、设计约束、建立测试体系、判断 AI 是否写对。这四项能力决定了 AI 产出的可信度。
看待变化的尺度
DHH 在 2025 年 5 月还公开表示"绝不把键盘交给 AI,宁愿退休",到 2026 年 4 月已经在播客中坦言转向 Agent 优先,并进一步预测五年内没多少人会再读写代码。这种一年内完成的态度转变,本身就是当前 AI 编码工具迭代速度的注脚。
值得记住的是,"没人写代码"并不等于"程序员消失"。当一行行代码的边际成本趋近于零,稀缺的反而是判断"什么值得做"和"什么才算正确"的能力。工具会变,但定义问题、验收结果、设计约束的工作,仍然需要人来承担。
对个人而言,更现实的姿态是尽早用真实项目跑通一次 AI 主导的端到端流程,感受效率边界与质量底线在哪里,而不是停留在争论它"能不能用"的阶段。