Kimi K3 对决 GPT-5.6:国产模型追平了吗?开发者怎么选?
OpenAI 总裁评价 Kimi K3 “相当不错”,是客套还是真认可?国产模型和 GPT-5.6 的差距到底还有多大?
- 一个被忽视的信号
7 月 22 日,OpenAI 总裁 Greg Brockman 说了句话:
“Kimi K3 无疑相当不错,但我们仍有巨大优势。”
放在两年前,OpenAI 对国产模型的态度是——不评价。不是不屑,是真的没到值得评价的水平。
所以这次表态本身,就是一个信号:
国产模型已经进入了 OpenAI 的“观察区”。
但后半句更值得琢磨。Brockman 提的不是文本生成能力——那已经是上一代的话题了。他说的“巨大优势”,指向的是别的东西。
我们稍后会聊这个。
- Kimi K3 到底怎么样?
Kimi K3 的升级方向很明确——补国产模型的短板。三个靶点:长上下文、代码工程、数学推理。
长上下文:200K Tokens
什么概念?一部《三体》全文大约 200 万字,折算下来约 400K Tokens。200K 能完整处理一本技术手册、一部中长篇小说、一整份财报 PDF 的全部内容。前代 128K 的问题在于“中间遗忘”——长文档读到后面,前面的细节已经模糊了。Kimi K3 把这个问题解决了。
代码生成:SWE-bench 45.6%
SWE-bench 是测试 AI 解决真实 GitHub Issue 能力的行业标准,比写个贪吃蛇难得多。前代约 28%,Kimi K3 跳到 45.6%。GPT-5.6 是多少?大约 50% 出头。差距缩到一个版本以内。
数学推理:AIME 2024 76%
AIME 是美国数学邀请赛,题目难度相当于国内高中数学竞赛。76% 的准确率意味着 Kimi K3 能做对四分之三的竞赛题。前代不到 50%。
中文理解:C-Eval 和 CMMLU 第一
这块没什么悬念。国产模型在中文语料上的训练深度天然占优。Kimi K3 把优势拉大了。
小结一下:
在中文客服、营销文案、长文档分析、日常代码编写这些占日常使用 80% 以上的场景里,Kimi K3 和 GPT-5.6 的体验已经互有胜负——甚至因为响应速度和成本优势,Kimi 反而更顺手。
- OpenAI 的“巨大优势”到底是什么? 如果单点能力已经被追近,OpenAI 凭什么说“仍有巨大优势”?
答案是四个层级的系统性领先。
第一层:迭代速度
GPT-5.4 发布后,OpenAI 推出了 GPT-5.5、GPT-5.6系列,几乎每 3-6 个月一次大版本更新。这不是某一个模型强,是整个组织的工程化输出能力强。国产模型追一个点容易,追持续的节奏难。
第二层:原生多模态
Sora 的视频生成、DALL-E 3 的图像生成,和 GPT 是深度耦合的——它们共用同一个表示空间。你用文字描述一段视频场景,GPT 理解意图,Sora 生成画面,中间不需要转译。国产的多模态能力目前大多还是“独立模型拼装”——一个模型做理解,一个模型做生成,用胶水代码粘在一起。体验上有差距。
第三层:强推理能力
o1 系列走的是一条不同的技术路线——不是更快地“猜”下一个 Token,而是在内部进行“慢思考”:先生成多条推理路径,再从中筛选最优解。这种能力在物理模拟、复杂算法调试、多步逻辑推理上表现出的稳定性,国产模型短期内还很难复制。
第四层:开发者生态
GPTs、插件市场、函数调用工具链——不是技术壁垒,是网络效应壁垒。开发者越多,插件越多,插件越多,开发者越多。国产模型在这块的生态还处于“技术打通了,但没人来做高质量插件”的阶段。
- 最后
Kimi K3 追平 GPT-5.6 了吗?
中文场景基本追平了。复杂推理、多模态、生态系统还有差距。
但真正值得关注的是另一件事——
国产模型第一次被 OpenAI 放在了“值得评价”的位置上。
这比任何单点分数都重要。
