INDEX / NO.013 — 2026.07.19 — 前沿追踪

Kimi K3 怎么这么强?强的不只是 2.8 万亿参数

KimiK3发布后,最显眼的数字是2.8万亿参数。

Kimi K3 发布后,最显眼的数字是 2.8 万亿参数。

但参数规模解释不了这次升级最值得关注的地方。K3 的重点不是把一道题答得更漂亮,而是在较少人工干预下,连续阅读代码、调用工具、查看结果,再回头修改方案。

Moonshot 给出的案例包括优化 GPU kernel、从头搭建一个小型 GPU 编译器、完成跨论文的计算研究,以及用开源 EDA 工具完成一次芯片设计验证。这些案例主要来自官方,尚不能证明普遍成功率,却清楚展示了 K3 的产品方向:一个面向长时程工作的 Agent 模型。

Kimi K3 官方发布视觉

图源:Kimi K3 官方技术博客

两组证据,分别说明了什么

K3 是否真的强,不能只看一张官方榜单。把 Moonshot 的发布材料和 Artificial Analysis 的独立测试放在一起,信息会更完整。

观察来源K3 的结果能说明什么不能说明什么
Artificial Analysis Intelligence Index v4.157 分,页面列第 4按该机构当时的综合指数与模型设置,K3 进入其前列不等于稳定的“全球第四”;榜单、方法和模型设置会更新
Kimi 官方评测与案例展示了多项长时程编程、知识工作和多模态任务结果Moonshot 将 K3 定位为面向长时程复杂工作的模型不能单独证明普遍成功率;部分比较的 Agent 运行环境不同,官方案例仍待复现

截至 2026 年 7 月 18 日,Artificial Analysis 页面显示,K3 的 Intelligence Index 为 57,在该页面同类比较的 187 个模型中列第 4。这个指数覆盖知识、科学推理、长上下文、终端和 Agent 等九项评估。它不能代表全部能力,但至少提供了一组与官方发布相对独立的综合信号。

Moonshot 自己也没有宣布全面领先。官方技术博客明确写道,K3 的整体表现仍落后于 Claude Fable 5 和 GPT-5.6 Sol,实际用户体验也存在明显差距。

更准确的描述是:K3 已经进入前沿模型的竞争区间,但现有公开证据不足以把它写成最强模型,也不足以据此判断中美模型的整体强弱。

2.8 万亿参数,并不是一起上班

K3 采用稀疏混合专家架构,也就是 MoE。它共有 896 个专家,每处理一个 token,只选择其中 16 个。

2.8 万亿描述的是模型的总参数容量,不代表每次生成都调用全部参数。MoE 的目标,是扩大模型容量,同时避免每个 token 的计算量与总参数等比例增长。

16/896 只表示被选中的专家数量占专家池不到 2%,不能理解成“只计算全部参数的 2%”,因为模型还有注意力层和其他非专家参数。如此高的稀疏度也会带来路由、负载均衡和跨设备通信难题。Moonshot 为此引入 Stable LatentMoE、Quantile Balancing 和全平衡专家并行训练等方法。

所以,参数规模是 K3 的基础,但真正的问题是:这些参数能否被稳定训练、准确选择并以可接受的成本运行。

KDA 和 AttnRes,分别处理长度与深度

K3 还有两项关键架构变化。

Kimi Delta Attention(KDA)面向长序列。传统全注意力在上下文变长后,计算和缓存压力会迅速上升。此前的 Kimi Linear 论文显示,KDA 可以降低长上下文的 KV cache 占用并提高解码吞吐。K3 提供 100 万 token 上下文,但窗口大不等于模型一定能有效使用全部信息,真实效果仍取决于任务和信息分布。

Attention Residuals(AttnRes)处理模型深度上的信息流。标准残差连接会把前面各层输出持续累加,AttnRes 则让当前层根据输入,有选择地聚合较早层的表示。Block AttnRes 再把这种选择压缩到层块级别,以降低内存和通信成本。

相关论文在一个 480 亿总参数、30 亿激活参数的 Kimi Linear 模型上报告了收益,但这不是 K3 的消融实验。Moonshot 称,KDA、AttnRes、更高的 MoE 稀疏度、训练方法和数据配方共同带来相对 K2 约 2.5 倍的整体 scaling efficiency。目前还不能把 K3 的提升单独归功于其中一项技术。

Kimi K3 官方评测对比图

图源:Kimi K3 官方技术博客。官方说明,不同评测按项目使用 Kimi Code、Claude Code 或 Codex 等不同 Agent 运行环境;部分其他模型成绩还引用自外部榜单或发布材料,不能视为严格统一条件下的裸模型横评

真正的变化,是模型与 Agent 系统开始合流

一个模型会写代码,不等于它能完成软件工程。后者要求它持续理解目标、浏览仓库、调用终端、观察报错、修改代码并重新测试,还要在漫长过程中保持任务状态。

Moonshot 披露的 K3 案例都在强调这种能力:GPU kernel 测试最长运行 24 小时;芯片案例是一次 48 小时自主运行;AI ASIC 行业研究经历 120 多轮递归改进,包含 2800 多次网页搜索或抓取,以及 1100 多次终端数据抓取。

这些是官方展示的成功案例。技术博客没有给出同类任务的总体成功率、失败样本、人类介入的量化次数和完整运行成本,因此不能据此断定 K3 已经能稳定完成所有复杂工作。

另一个容易被忽略的变量是 Agent 运行环境。Moonshot 在部分评测中让 K3、Claude 和 GPT 分别运行在 Kimi Code、Claude Code、Codex 等不同环境下。工具定义、上下文管理和错误处理都会影响最终成绩。K3 的领先更适合被理解为模型与 Agent 系统的综合表现,而不是一次裸模型能力鉴定。

下一轮竞争,不只发生在模型里

K3 带来的行业信号,不是谁已经全面超过谁,而是前沿能力越来越难用一个参数规模或一张榜单概括。模型、推理预算、上下文管理和 Agent 运行环境,正在共同决定任务结果。

模型能否在长任务里保留目标,能否稳定调用工具,运行环境是否适配,单位任务需要多少时间和成本,最终产物能否验证,这些因素会共同决定 Agent 的实际价值。

截至 2026 年 7 月 18 日,K3 的完整技术报告和模型权重尚未发布。Moonshot 计划在 7 月 27 日前发布完整权重。等这些材料公开后,外界才能进一步判断:K3 展示出的能力有多少来自模型架构,有多少来自训练、推理预算和 Kimi Code,又有多少能在第三方环境中复现。

K3 现在已经给出了一个清晰方向:前沿模型的竞争,正在从“谁更会答题”,走向“谁能把一件复杂工作持续做完”。


参考资料:

  1. Kimi K3 Tech Blog: Open Frontier Intelligence
  2. Kimi K3 API Quickstart
  3. Artificial Analysis: Kimi K3 Intelligence, Performance & Price Analysis
  4. Attention Residuals
  5. Kimi Linear: An Expressive, Efficient Attention Architecture
扫码关注公众号
扫码关注公众号
扫码加群交流
扫码加群交流