根据 Artificial Analysis 已更新的 AA-Briefcase 基准测试,Kimi K3 达到了 1543 Elo 分,仅次于 Claude Fable 5 的 1574,并超越 GPT-5.6 Sol 的 1501。该基准在 91 项保密任务上评估模型在信息抽取、文档分析和交付物生成方面的表现。
然而,K3 的性能提升伴随着显著更高的成本:每项任务 $10.57,约为 Kimi K2.6 的 10 倍。模型平均进行了 83 次迭代,并在每项任务中生成 120,000 个 tokens,完成需要 56.4 分钟——大约比 Fable 5 长 2.5 倍。