
Kimi K3 hits top-tier performance, but high per-task cost and weak margins hinge on KV cache.
Kimi K3 的整体表现进入全球领先行列。它是一个2.8万亿参数的大型 MoE 模型,支持100万 token 上下文,在编程、Agent 和长周期知识工作等测试中表现突出。全球用户的第一轮反馈也基本认可其能力,尤其是复杂 coding 和长任务执行;但模型刚发布,真实场景中的稳定性、成功率和单位任务成本仍需进一步验证。
K3 再次说明,scaling law 并没有失效,更大规模的模型绝对性能通常还是更好。架构优化、MoE、蒸馏和 post-training 可以提高参数与算力的使用效率,但要继续提升复杂推理、长期规划和 Agent 能力,增加模型规模仍然是最直接的路径。K3 从 K2 系列继续显著扩大模型规模后,能力也出现了明显跃升;这说明架构创新更多是在改善 scaling efficiency,而不是取代 scaling 本身。
全球社区对 K3 的评价总体正面。很多用户认可其 benchmark、编程和长周期 Agent 表现,同时也担心它目前只能运行最高 reasoning effort,缺少低成本、低延迟的轻量模式。也就是说,K3 可能比较适合高价值复杂任务,但对大量简单请求未必经济:模型可能思考得更久、生成更多 reasoning token,完成同样任务所消耗的推理算力也可能高于能够动态调节思考深度的模型。
定价上,K3 实际上并不便宜。其 API 价格为未命中缓存输入 3美元/百万 token、输出 15美元/百万 token,与 Claude Sonnet 的标准价格基本一致;相比之下,GLM 5.2 的官方价格约为输入1.4美元、输出4.4美元,K3 的输入价格超过其两倍,输出价格约为其3.4倍。即使考虑 Sonnet 5 当前2美元/10美元的推广价格,K3 反而还更贵。因此,K3 不再是传统意义上依靠低价竞争的中国模型,而是直接采用了接近美国一线闭源模型的定价。不过,K3 的单 token 定价虽然低于 Fable 和 Sol,但实际单任务成本未必便宜:在 Artificial Analysis 的测试中,K3 每项任务成本约 0.94 美元,已经接近 GPT-5.6 Sol 的 1.04 美元。
This report is available to subscribers. Sign in or subscribe to read the full analysis.