一句话结论
Kimi K3 是迄今全球最大的开放权重模型——2.8 万亿参数,首个"3 万亿级"开放模型,原生多模态,100 万 token 上下文。它靠一次卡在上海世界人工智能大会(WAIC)开幕前的发布,把"中国开源追赶美国前沿"的叙事推到了新高度:在前端编码、长程 Agent、深度信息检索三条细分赛道上,第三方榜单已把它排到第一或第二。
但要把话说准:它是"逼近前沿",不是"登顶前沿"。Moonshot 自己也承认,综合能力仍落后 Anthropic 的 Claude Fable 5 与 OpenAI 的 GPT-5.6 Sol;独立第三方(Artificial Analysis)把它放在总榜第 4,与 GPT-5.5、Claude Opus 4.8 同档。真正的看点在两个未落地的承诺:7 月 27 日的完整权重开源,以及随后的技术报告——它们才决定 K3 是一次公关高光,还是开源生态的一次结构性位移。
01
事件全景:一次精心卡位的发布
2026 年 7 月 16 日(周四)至 17 日(周五),北京的 Moonshot AI(月之暗面)发布了旗舰模型 Kimi K3。命名延续 K2 系列——注意:外界口语里的"Kimi 3",官方正式名是 Kimi K3。发布节点几乎不可能是巧合:它卡在上海 2026 世界人工智能大会(WAIC)开幕前,与中国最高领导人的大会致辞同期,新华社随即将其定性为国家级里程碑。
为什么这次发布值得单独写一份报告
- "全球最大开放模型"是个硬标签:2.8T 参数、首个逼近 3 万亿的开放权重模型,比此前领跑中国开源的 DeepSeek V4-Pro / 美团 LongCat-2.0(约 1.6T)大了约 75%。规模本身就是一次宣示。
- 它是一次触底反弹:VentureBeat 直言,18 个月前 Moonshot 还是"市场宠儿如何迅速失位"的反面教材——DeepSeek 的崛起一度大幅侵蚀其位置。K3 是它重回牌桌的筹码。
- 时间点叠加地缘信号:据 Kyodo 报道,就在一个月前,Anthropic 的 Fable / Mythos 因安全顾虑被美方紧急下架;K3 在此背景下发布,凸显中国开放生态的追赶速度。
关于发布方:Moonshot AI 成立于 2023 年,北京,创始人杨植麟(AP 的描述是"在匹兹堡拿到博士学位、喜欢 Pink Floyd 的创业者"),阿里巴巴为其投资方。据 Bloomberg,公司于 2026 年 5 月以逾 200 亿美元估值完成 20 亿美元融资。
02
模型规格与架构:2.8T 是怎么造出来的
先把规格放在同类里对照——K3 的"大"不是渐进式的大,而是断层式的大。
开放权重模型总参数量对照:K3 是断层式的领先
总参数量(万亿),据 Moonshot 官方时间线图与媒体转述口径
来源:Moonshot 官方开放前沿模型规模时间线图(媒体转述)。作为对照:K3 比先前领跑中国开源的 1.6T 一档高出约 75%,是首个逼近 3 万亿的开放权重模型。厂商自绘图存在选择性,仅作量级参考。
核心规格
Kimi K3 关键规格
| 维度 | 参数 | 说明 |
| 总参数量 | 2.8 万亿(2.8T) | 全球最大开放权重模型,首个"3T 级"开放模型 |
| 上下文窗口 | 100 万 token(1M) | 可在单次提示内保留远超上一代的信息量 |
| 多模态 | 原生视觉理解 | 非外挂式,训练阶段即引入视觉 |
| 推理模式 | 常开"thinking mode" | 发布时默认 max effort;后续将补 low / high 档 |
| 专家结构 | 896 选 16(MoE) | Stable LatentMoE 框架下的稀疏激活 |
| 训练精度 | MXFP4 权重 + MXFP8 激活 | 从 SFT 阶段起做量化感知训练(QAT),兼顾硬件兼容 |
| 缩放效率 | 较 K2 约 +2.5× | 把算力更高效地转化为智能(官方口径) |
两项架构主张:让模型"能长到万亿以上还稳"
Moonshot 把 K3 的可扩展性归到两个内部研发、且此前已在 GitHub 公开的技术上:
- Kimi Delta Attention(KDA):一种混合线性注意力机制,为在超长序列上扩展注意力提供高效基座。它也给传统前缀缓存带来新挑战,Moonshot 称已向 vLLM 社区贡献了对应实现,与权重同步放出——这是把长上下文的推理成本压下来的关键工程。
- Attention Residuals(AttnRes):被描述为残差连接的"即插即用替代",跨深度有选择地检索表示,而非逐层均匀累加,从而在超万亿规模上持续获得缩放收益。
在此之上,K3 还叠了一组训练与优化技巧以在 2.8T 规模上保持稳定:Quantile Balancing(用路由分数分位数直接推导专家分配,去掉敏感的平衡超参)、Per-Head Muon(对注意力头独立优化)、SiTU 激活与 Gated MLA。工程侧,官方建议在 64 个及以上加速器的 supernode 上部署——这也是它"开源但难本地跑"的现实注脚。
谨慎看待:上述架构细节均出自官方博客,完整技术报告尚未发布。KDA / AttnRes / LatentMoE 的真实收益、以及"2.5× 缩放效率"这类数字,需等第三方复现与技术报告披露后再定论。
03
基准成绩:细分登顶,综合第二梯队
K3 的成绩单要分两类读:第三方独立评测(可信度高)与 Moonshot 自报(需打折)。先看第三方。
Kimi K3 关键基准(第三方来源为主)
| 基准 / 榜单 | K3 成绩 | 性质 | 对照 |
| Arena.ai — 前端 / Web 界面构建 | 排名 第 1 | 第三方 | 细分赛道登顶 |
| Vals AI — 综合总榜 | 第 2 | 第三方 | 仅次于 Claude Fable 5,领先 GPT-5.6 Sol |
| Artificial Analysis — 综合 | 第 4 | 第三方 | 与 GPT-5.5、Claude Opus 4.8 同档 |
| BrowseComp — 长程信息检索 | 91.2(SOTA) | 第三方 | 1M 上下文无管理时 90.4 |
| GDPval-AA v2 — 44 职业真实任务 | 1,687(第 3) | AA 私测 | 落后 Fable 5 Max(1,815)、GPT-5.6 Sol Max(1,747.8);超 Opus 4.8(1,600) |
| AA-Briefcase — 长程知识工作 | 1,527(第 2) | AA 私测 | 超 GPT-5.6 Sol Max,落后 Fable 5 Max |
| 编码 / 通用 Agent | 胜 Opus 4.8 与 GPT-5.5 | 厂商自报 | 使用 KimiCode harness,需独立复现 |
| GPU kernel 优化 | 约等于 Fable 5 | 厂商自报 | 显著超 Opus 4.8 / GPT-5.6 Sol / GPT-5.5 |
怎么读这份成绩单
- 细分赛道真有第一:前端/Web 构建(Arena.ai)登顶、深度检索(BrowseComp)SOTA,这两个是第三方榜单,含金量高。K3 的强项集中在编码、长程 Agent、信息检索——都吃"长上下文 + 强推理"这口饭,与它 1M 窗口、常开 thinking 的设计一致。
- 综合仍是第二梯队:最中性的独立评测(Artificial Analysis)把它放在总榜第 4,与 GPT-5.5、Opus 4.8 同档;Moonshot 自己承认整体落后 Fable 5 与 GPT-5.6 Sol。所谓"逼近前沿",准确说是逼近前沿的次顶层。
- 自报数字要打折:不少最亮眼的胜负来自 Moonshot 自用的 KimiCode harness,评测脚手架不同会显著影响结果,宜等第三方在统一 harness 下复现。
一个值得记住的定位:K3 不是"全面超越 Claude / GPT",而是以开放权重的身份,第一次把中国模型稳定地送进了前沿次顶层,并在几个细分上抢到榜首。对开源生态,这个位置本身就足够有分量。
04
可用性、定价与开源节奏
现在就能用
- 入口:kimi.com、Kimi 手机 App、Kimi Work、Kimi Code、Kimi API,以及 OpenRouter(无需 Moonshot 账号即可直接调用)。
- 兼容性:API 兼容 OpenAI SDK,已在 OpenAI / Anthropic 工具链上开发的团队迁移成本很低。
- 开箱注册:kimi.com 用 Google 账号或手机号即可注册,无需信用卡。
定价:中端价位,前沿附近的性能
Kimi K3 API 定价(每百万 token)
| 项目 | 价格 | 备注 |
| 输入 | $3.00 | 与西方实验室中端产品大致持平 |
| 输出 | $15.00 | — |
| 缓存输入 | $0.30 | 自动上下文缓存,无需额外参数——对长上下文场景是实打实的成本优势 |
另有促销:8 月 12 日前,单笔 ≥$1,000 的 API 充值最高返 30% 代金券。定价策略很清楚——用中端价格卡逼近顶端的性能,抢开发者迁移。
开源节奏:关键承诺尚未兑现
- 完整权重:计划于 2026-07-27 前发布,技术报告同期放出。发布时仅 API/产品可用,权重和 vLLM 的 KDA 前缀缓存实现将一并开放。
- 旧模型退场:kimi-k2.5 与 moonshot-v1 系列对新注册用户停售,平台计划 8 月 31 日全面退役,官方引导迁移到 k3 及 kimi-k2.7-code 系列。
最大的悬念:截至本报告检索时点(07-17),权重尚未开源、技术报告尚未发布、开源许可证条款未知。"全球最大开源模型"的分量,全押在 7 月 27 日这个承诺能否如期、以何种许可证兑现上。在此之前,它严格说是"开放访问 + 承诺开放权重"。
05
竞争格局与地缘背景
在中国开源阵营里的位置
K3 之前,中国开源第一梯队是美团 LongCat-2.0 与 DeepSeek V4-Pro(均约 1.6T 总参数),其余多家刚跨过万亿门槛。K3 以 2.8T 一举把上限拉高约 75%。VentureBeat 的解读点破了战略意图:靠"全球最大开源模型"这块招牌,Moonshot 是在争夺全球开源开发者社区的引力中心——谁的模型成为社区默认的微调与二次开发基座,谁就掌握生态话语权。
与美国前沿的相对位置
- 顶端仍在美方:Claude Fable 5、GPT-5.6 Sol 综合领先;K3 与 Claude Opus 4.8、GPT-5.5 这一"次顶层"同档,并在个别细分反超。
- 地缘叙事被放大:据 Kyodo,一个月前 Anthropic 的 Fable/Mythos 曾因安全顾虑被美方下架;K3 恰在此窗口发布,被广泛解读为"中国开放生态正快速收窄与最先进美系的差距"。新华社与中关村学院院长刘铁岩把它定性为中国开源"从零散突破走向集体跃进"的标志。
一句话格局:美方守住综合最顶端,中方用"开放权重 + 中端定价 + 细分登顶"三件套持续施压。K3 不改变谁在最前沿,但显著改变了开源可用的最高水位。
06
舆论与社区反响
社区热度是本次发布最直观的一面——尤其在英文技术社区,讨论量与情绪都很高。
Reddit 主要讨论帖(截至 2026-07-17)
| 板块 / 标题 | 赞 | 评论 |
| r/OpenAI《Kimi-K3 arrived: 中国实验室远远落后的时代结束了》 | ~1,980 | 435 |
| r/LocalLLaMA《Kimi K3 Benchmarks》 | ~1,239 | 366 |
| r/LocalLLaMA《Kimi K3 released on web and app》 | ~626 | 271 |
| r/singularity《Kimi K3 Benchmarks》 | ~506 | 205 |
- 核心情绪:"中国实验室远远落后的时代结束了"——r/OpenAI 的这条帖子近 2,000 赞,是本次反响的情绪坐标。
- 本地部署党的纠结:r/LocalLLaMA 极度活跃,但 2.8T + 建议 64 加速器的门槛,意味着"开源"对绝大多数个人用户短期内偏象征意义——真正能本地跑的极少,讨论更多集中在量化、蒸馏与云端调用。
- 主流媒体齐发:AP、CNBC、VentureBeat、Kyodo 在 24 小时内密集报道,共同把它框定为"中国开源逼近美国前沿"的标志性事件。
07
待验证清单:接下来看什么
这份报告写在"承诺已出、证据未全"的时点。以下几项将决定 K3 是一次公关高光,还是一次生态位移——按重要性排序。
Kimi K3 跟踪清单
| 要看的事 | 时点 | 为什么关键 |
| 完整权重能否如期开源,及许可证条款 | 2026-07-27 前 | 决定社区能否真正本地复现/微调——"全球最大开源模型"名号的全部分量所在 |
| 技术报告发布 | 权重同期 | KDA / AttnRes / LatentMoE 与"2.5× 缩放效率"能否被验证 |
| 第三方在统一 harness 下复现编码/Agent 成绩 | 数周内 | 厂商自报(KimiCode harness)的领先能否落地 |
| vLLM 的 KDA 前缀缓存落地与实测 | 权重同期 | 决定 1M 长上下文的真实推理成本,是定价可持续性的基础 |
| 本地/量化部署可行方案成熟度 | 1–2 个月 | 2.8T 门槛极高,社区能否给出可用的量化/蒸馏路径 |
| API 稳定性与实际调用体验 | 持续 | 发布默认 max effort,延迟与限流的真实表现待观察 |
关联信息源
- 官方:kimi.com/blog/kimi-k3(技术博客)、platform.kimi.ai/docs/models(模型清单与定价)、moonshot.ai。
- 媒体:VentureBeat(架构与基准最详)、CNBC、AP News、Kyodo News。
- 社区:Reddit r/OpenAI、r/LocalLLaMA、r/singularity。
方法与边界说明:本文数据检索于 2026-07-17,来源包括 Moonshot / Kimi 官方博客与 API 文档、VentureBeat(2026-07-16)、CNBC / AP News / Kyodo News(2026-07-17)、Artificial Analysis 与 Arena.ai / Vals AI 榜单转述,以及 Reddit 社区讨论。关键事实提醒:截至检索时点,Kimi K3 的完整权重与技术报告尚未发布,架构细节与"2.5× 缩放效率""细分登顶"等表述多来自官方博客或厂商自用评测脚手架(KimiCode harness),第三方独立复现尚不充分;参数量对照图基于厂商自绘时间线,存在选择性。文中已尽量区分"第三方评测"与"厂商自报"两类证据,请据此打折看待。本文为事实梳理与解读,不构成投资或采购建议。