跳转到主内容

Kimi K3 发布:2.8T 参数、1M 上下文与开放权重计划

梳理 Kimi K3 的发布时间、2.8T 参数规模、1M 上下文、核心架构、API 价格与开放权重计划,并分析它适合哪些任务。

技术分享AIKimi大模型

前言

2026 年 7 月 16 日,Moonshot AI 正式发布 Kimi K3。和常规的小版本更新相比,K3 最显眼的地方是把模型规模推到了 2.8T 参数,同时提供原生视觉能力和 1M token 上下文窗口,目标也从普通对话进一步转向长时间编程、知识工作和复杂推理。

我刚刚在主流大模型发布时间汇总表里补充了 Kimi K3,这篇文章再单独整理一下它的核心信息,以及这些参数对普通用户和开发者究竟意味着什么。

先说结论:Kimi K3 已经可以在 Kimi.com、Kimi Work、Kimi Code 和 Kimi API 中使用,但“产品和 API 已上线”不等于“完整模型权重已经可以下载”。Moonshot AI 给出的计划是,在 2026 年 7 月 27 日前发布完整权重和更多技术资料。

Kimi K3 的基本信息

项目信息
发布时间2026 年 7 月 16 日
模型规模2.8T 总参数
模型结构KDA、Attention Residuals、稀疏 MoE
专家配置896 个专家,每次有效激活 16 个
上下文窗口最高 1M token
多模态能力原生视觉,可处理文本、图片和视频相关任务
API 模型名kimi-k3
当前入口Kimi.com、Kimi Work、Kimi Code、Kimi API
完整权重官方计划于 2026 年 7 月 27 日前发布

这里最容易产生误解的是“2.8T 参数”。它指的是模型的总参数规模,并不意味着每生成一个 token 都会调用全部参数。Kimi K3 使用稀疏 Mixture of Experts(MoE)结构,在 896 个专家中有效激活 16 个,通过稀疏路由控制实际计算量。

因此,2.8T 更适合用来理解模型的容量和架构规模,不能直接等同于推理速度、显存占用或实际效果。评价一个 MoE 模型,还要结合激活参数、上下文长度、推理框架、量化方式和具体任务。

三个值得关注的架构变化

Kimi Delta Attention

Kimi Delta Attention,简称 KDA,是 Kimi 在注意力机制上的扩展。传统全注意力在上下文变长后,计算和缓存成本会快速上升;KDA 希望在保留长文本建模能力的同时,提高长序列处理效率。

对用户来说,最直观的结果不是“注意力公式变了”,而是 K3 可以把最高上下文窗口扩展到 1M token,并面向大型代码仓库、长文档和持续多轮任务设计。不过,1M 上下文只是容量上限,不代表把所有文件一次性塞进去就一定能得到更好的答案。检索方式、上下文组织和提示词质量仍然很重要。

Attention Residuals

Attention Residuals(AttnRes)调整了深层网络中的信息传递方式。普通残差连接会逐层累积表示,而 AttnRes 允许模型从不同深度选择性地取回信息,减少重要内容在深层传播中的损失。

这类改进主要服务于长程推理和复杂任务。一个 Agent 连续工作几十轮时,需要同时保留任务目标、已经完成的步骤、工具输出和中间决策,信息传递是否稳定会直接影响后半程质量。

更稀疏的 MoE

Kimi K3 使用 Stable LatentMoE,并把专家规模扩展到 896 个,每次有效激活其中 16 个。官方称,结合新的训练与数据方案,K3 相比 K2 获得了约 2.5 倍的整体扩展效率提升。

这个数字来自官方技术博客,适合用来理解 K3 的设计方向,不应简单当成“性能提升 2.5 倍”。模型的真实体验仍然取决于任务类型、推理强度、服务速度和使用的 Agent 框架。

Kimi K3 重点强化了什么

长时间编程任务

K3 的定位并不只是补全几行代码,而是持续浏览大型仓库、调用终端工具、修改多个文件并完成较长的工程任务。官方展示的案例包括 GPU Kernel 优化、编译器开发、游戏与 3D 内容制作、芯片设计和科研代码实现。

这些案例说明 Moonshot AI 想强化的是“长程 Agent 能力”:模型能否在较少人工介入的情况下保持目标,连续执行多个步骤,并根据运行结果继续调整。

不过,官方案例通常处于精心准备的评测或演示环境中。实际开发中仍然需要版本控制、自动化测试、权限边界和人工审查,不能因为模型可以长时间运行,就把生产环境完全交给它。

原生视觉与视觉反馈闭环

K3 具备原生视觉能力,可以在编程过程中读取截图,再根据界面效果继续修改代码。这对前端、游戏、CAD 和数据可视化任务比较有价值,因为模型不再只能阅读源码,还能观察实际渲染结果。

“能看见页面”和“能稳定做出好设计”仍然是两回事。视觉反馈可以减少明显的布局错误,但交互逻辑、可访问性、响应式适配和设计一致性依然需要系统测试。

知识工作

Moonshot AI 还把 K3 用在行业研究、科学资料分析、电子表格、演示文稿和交互式报告等任务中。1M 上下文和多 Agent 并行能力适合处理大批资料,但也更容易放大来源质量问题。

如果用于研究类任务,最好要求模型保留引用、区分事实与推断,并对关键数字进行二次核对。上下文变长只能让模型看到更多信息,不能自动保证所有信息都准确。

API 价格与使用入口

Kimi K3 的 API 模型名为 kimi-k3。官方首发价格如下:

计费项目每百万 token 价格
命中缓存的输入0.30 美元
未命中缓存的输入3.00 美元
输出15.00 美元

长上下文任务的输入量可能很大,缓存命中率会明显影响最终成本。官方表示,其编码工作负载中的缓存命中率可以超过 90%,但开发者自己的请求结构未必能达到相同结果。

目前可以通过以下方式体验:

  1. Kimi.com 或 Kimi 移动端使用。
  2. 使用 Kimi Work 3.1.0 或更高版本。
  3. 在 Kimi Code 中通过 /model 选择 Kimi K3。
  4. Kimi API 平台选择 kimi-k3

Kimi Code 的更新文档已经列出 lowhighmax 三档思考强度。不同产品、会员等级和发布阶段的可用配置可能不同,实际使用时应以客户端当前显示为准。

“开放模型”目前开放到了哪一步

Kimi K3 被官方描述为首个开放的 3T 级模型,但截至本文核对时,完整权重仍处于预告阶段。当前已经确定的是:

  1. Kimi K3 的产品和 API 已经上线。
  2. 官方技术博客公开了主要架构和部分评测方法。
  3. 完整权重计划于 2026 年 7 月 27 日前发布。
  4. 更完整的技术报告和相关推理支持预计与权重一起公布。

所以现阶段更准确的说法是“Kimi K3 已发布,完整开放权重即将发布”。等权重、许可证和部署文档真正公开后,才能进一步判断社区能否顺利本地部署、量化、微调和集成。

2.8T 的总参数规模也决定了它不会是普通消费级显卡能够轻松运行的模型。即使权重开放,完整部署大概率仍然面向大型推理集群;社区更实际的关注点可能是量化版本、推理框架适配、托管服务和后续蒸馏模型。

官方披露的局限

这次官方博客没有只展示优势,也列出了几个值得注意的问题。

首先,K3 对历史思考内容比较敏感。如果 Agent 框架没有按要求保留完整的 thinking history,或者在一个旧会话中途从其他模型切换到 K3,输出质量可能变得不稳定。官方建议使用经过验证的框架,并在切换到 K3 时新建会话。

其次,K3 在长程任务训练中比较强调主动推进。当任务边界不清晰时,它可能替用户做出超出预期的决定。如果接入文件系统、终端、浏览器或企业数据,应该在系统提示词或 AGENTS.md 中明确权限、禁止操作和确认节点。

最后,官方也承认 K3 的整体用户体验与最强的闭源模型仍有差距。官方基准测试可以作为参考,但不同模型使用的 Agent harness、思考强度和工具环境并不完全相同,不能只看一张分数表就得出绝对结论。

是否值得尝试

如果你的任务涉及大型代码仓库、长文档、视觉编程、复杂研究或持续多步执行,Kimi K3 很值得测试。它的 1M 上下文、原生视觉和长程 Agent 定位,确实覆盖了当前 AI 工具比较重要的发展方向。

如果只是普通问答、短文本改写或简单代码补全,K3 的最大思考强度和长上下文未必有明显优势,还可能带来更高延迟与输出成本。模型选择最终还是要回到任务:用小模型处理简单高频工作,把大型推理模型留给真正需要长程规划和复杂工具调用的场景。

总结

Kimi K3 的意义不只在于“参数变成了 2.8T”。更值得关注的是,Moonshot AI 正在把超大规模 MoE、长上下文、原生视觉和 Agent 工作流组合到同一个模型中,并尝试通过稀疏架构和缓存系统控制推理成本。

它已经是一个可以实际体验和调用的产品,但开放权重、技术报告、社区推理适配和第三方评测仍需等待。7 月 27 日之后,K3 能否从一个强大的在线模型进一步变成真正可研究、可部署的开放模型,才是下一阶段更值得观察的事情。

参考资料

版权声明

作者
Dawn
许可
本博客所有文章除特别声明外,均采用CC BY-NC-SA 4.0许可协议。转载请注明来源 Dawn's Blog!