一组让账单说话的数据
单看官方调价,GPT-5.6 Terra 最近一次降价发生在 7 月 30 日,幅度只有 20%。但到了 8 月 24 日 OpenAI 与 AWS 公布的联合测试结果里,Terra 在 Terminal-Bench 2.1 上完成一个成功任务的成本降了约 82%。
Terminal-Bench 2.1 不像传统基准只让模型答卷。它把模型丢进一个真实的终端环境,给一个模糊目标,让它自己规划路径、调工具、写脚本、处理报错并反复迭代。榜单右侧的"成本"列和左侧的"准确率"列同样重要。
同一份榜单上四组对比最具冲击力:
- Claude Code 配 Fable 5:83.8%,552.67 美元
- Codex 配 GPT-5.5:83.1%,2059.19 美元
- Codex 配 GPT-5.6 Terra:78.4%,421.15 美元
- Codex 配 GPT-5.6 Luna:75.7%,241.45 美元
前两行准确率只差 0.7 个百分点,账单却差了将近 4 倍;后两行用的同一档模型体系,准确率低 2.7 个百分点,费用只有六成左右。这说明在编程智能体场景下,"花多少钱做完一件事"开始和"做对了多少"一样值得关注。
八成的成本从哪省出来:三个层级的协同
单价降 20%、账单降 82%,中间的 60 个百分点才是真正的看点。OpenAI 把编程场景的成本结构拆成了三层:
- 发起请求、组织上下文的智能体框架
- 负责中间调度的编排系统
- 最终在 GPU 上跑的模型本身
Terra 最近一次公开降价只有 20%,剩下那块大幅降本主要落在前两层和模型使用方式上。更直白地说,少烧的是"原本会白花的 token"——智能体跑偏后兜圈子再回头、选错路径反复试错的中间步骤,以及失败后的重试。
可以把这个过程理解为:折扣调的是菜单价,省下的则是点多了又退掉、做完才发现点错的那部分钱。
同一个模型、不同框架,账完全不一样
Terminal-Bench 2.1 跑的是"智能体 + 模型"的组合,而不是裸模型。同一个 GPT-5.6 Terra,放进 Kiro 得到的分数是 78.4% / 421.15 美元;放进 Codex 得到的是同档准确率但完全不同的上下文组织和工具策略。
这层差异在编程场景里非常关键,因为多数 token 消耗来自智能体框架如何描述任务、工具如何被调用、出错后怎么恢复,而不是模型单次回答时用了多少字。模型选型和框架选型开始被绑在一起评估。
Kiro 的 spec-driven 打法:把任务规整化再交给模型
Kiro 把用户体验切成了三个入口:IDE、CLI、Web。它的核心策略可以概括成一句话——不许上来就写代码。
具体流程是:先把用户那句含糊的目标拆成正式的需求文档、技术设计、可执行任务清单,再交给模型执行;代码真正落下去之前留一道闸让人过一眼;任务完成后再自动跑一轮测试做验证。这一套机制直接吃掉了"最贵的开销"——返工与推倒重来。
按 Kiro 官方数据,Terra 在 Coding Agent Index 上拿到 77.4,只比 Claude Fable 5 的 77.2 高一点点。它的卖点不在分数本身,而在于支撑这一分数的账单。
三档模型分工:Sol 定计划、Luna 做执行
GPT-5.6 家族在 Kiro 里分 Sol、Terra、Luna 三档。它们不是简单的"快慢配",而是能力档位的区分。
一种被官方举例的工作流是:先用 Sol 把问题想清楚、定好计划,再切到 Luna 去执行那些已经定义清楚的改动、写测试、跑评估。同一段流水线,不同环节配不同档位的智能,可以避免"用最贵的那档去做最机械的那段"。
7 月 30 日 OpenAI 调价落地后,Kiro 次日跟进更新了倍率:Luna 从 0.6 倍砍到 0.1 倍,Terra 从 1.2 倍降到 1.0 倍,Sol 未动。账面上看,三档都明确标了价,分别对应规划、执行与中间档三种使用方式。
如何用起来:接入路径与上手建议
GPT-5.6 在 Kiro 的可用性受多重要素限制,需要提前了解:
- 接入方式:GPT-5.6 Sol、Terra、Luna 于 7 月 13 日通过 Amazon Bedrock 正式可用,7 月 14 日在 Kiro 的 IDE、CLI、Web 三个端同时上线。开发者通过 Kiro 的模型选择器调用,无需单独管理 OpenAI API 密钥。
- 适用区域:目前只在两个区域开放,分别是美国的弗吉尼亚北部和欧洲的法兰克福,支持跨区域推理。
- 用户门槛:三款模型属于渐进式、实验性开放,目前面向 Pro、Pro+、Pro Max 和 Power 用户,其他档位暂不可见。
上手建议:
- 先用 Luna 跑已经定义清楚的子任务,例如补测试、改造字段、写固定模板的脚本。Luna 在 Kiro 里的倍率被砍到 0.1 倍,单次成本最低。
- 涉及架构选择、跨模块改动、需求拆分时切到 Sol,因为这类任务前期规划成本最高。
- Terra 介于两者之间,适合做主力模型。如果团队刚开始评估,建议先用 Terra 跑一两周拿到自己的真实基线,再决定要不要在规划环节换 Sol、执行环节换 Luna。
- 在 Kiro 里同样要走 spec 流程:把目标交上去之后,先看 Kiro 生成的需求文档和任务清单再放行,不要直接跳过这一步。
局限与边界
回到那组对比数据,要把结论限定在它能支撑的范围内:
- 82% 是单任务成本下降,不是 API 单价下降。把它当成"模型比上一代便宜 82%"是误读。
- 准确率上,GPT-5.6 Terra 在 Terminal-Bench 2.1 上的 78.4% 仍低于 Claude Code 配 Fable 5 的 83.8%。这是一笔用更低准确率换更低总账的交易,是否划算取决于任务本身对正确率的要求。
- 三档模型在 Kiro 里走的是隐藏思维链,用户看不到模型的中间推理步骤,只能看到最终输出。习惯调试逐步推理过程的人会感到不透明。官方的说法是不影响输出质量,但这对排查具体错误不友好。
- 当前 GPT-5.6 在 Kiro 是渐进式、实验性开放,区域只有两个,账号档位仅限 Pro 及以上。这意味着生产环境的稳定使用仍需观察。
- 上述数据来自 OpenAI 与 AWS 的联合测试、Kiro 官方博客和 Terminal-Bench 2.1 公开榜单,榜单口径只覆盖其中几种框架组合,未涵盖所有编程智能体框架。
编程场景里真正改变的是评价标准:分数高不再默认能赢,花钱少同样能赢。在挑模型之前,更值得先问一句——"让这套组合把这件事做完,我到底要花多少。