一句话摘要:月之暗面在WAIC 2026开幕前夜放出王炸——Kimi K3以2.8万亿参数成为全球首个突破2万亿级别的开源模型,实测综合智能仅次于Claude Fable 5和GPT-5.6 Sol,国产大模型正式进入全球第一梯队。
- 2.8万亿参数,全球最大开源模型,首个突破2万亿级别
- 100万token上下文窗口,原生支持视觉理解
- 实测接近Claude Fable 5和GPT-5.6 Sol水平
- 自研KDA混合线性注意力架构,扩展效率提升2.5倍
- API定价首次进入国际旗舰价位带
一、Kimi K3是什么?一张表看清核心参数
7月16日晚间,月之暗面(Moonshot AI)正式发布了旗下迄今最强的大模型Kimi K3。这款模型在WAIC 2026世界人工智能大会开幕前夜亮相,迅速成为整个AI圈最热门的话题。
| 参数项 | 详细信息 |
|---|---|
| 参数规模 | 2.8万亿(2.8T) |
| 架构 | Kimi Delta Attention(混合线性注意力)+ Attention Residuals |
| 上下文窗口 | 100万token |
| 多模态 | 原生视觉理解(图文混合输入) |
| 专家数量 | 896个专家,每次推理激活16个(MoE) |
| 思考模式 | 始终开启,仅max一档 |
| 新能力 | tool_choice工具约束、动态加载工具 |
| 开源状态 | 模型权重将在未来数天内发布 |
2.8万亿参数是什么概念?此前开源模型的参数纪录保持者也是月之暗面自己的K2系列,而K3直接将规模提升到了近3倍。更重要的是,K3是全球首个突破2万亿参数级别的开源模型,这意味着开源社区第一次拥有了与顶级闭源模型正面竞争的基础设施。
二、技术架构:KDA + MoE,如何让近3万亿参数跑起来?
参数多不意味着模型强,关键在于怎么用。Kimi K3在架构层面做了两项关键创新:
1. Kimi Delta Attention(KDA)混合线性注意力
传统的Transformer注意力机制,计算量随上下文长度呈平方级增长。KDA将线性注意力和标准注意力混合使用,在保持长上下文理解能力的同时大幅降低计算开销。这就是为什么K3能在100万token的窗口下维持可用定价——没有这套架构,算力成本将高到无法商业化。
2. Attention Residuals(注意力残差)
信息在深层网络中容易出现衰减和丢失。注意力残差机制让信息在更深的模型层和更长的序列中流动得更顺畅,直接提升了模型处理复杂任务的稳定性。
3. Stable Latent MoE框架
K3拥有896个专家,但每次推理只激活其中16个——稀疏度极高。结合Stable Latent MoE框架,模型的整体扩展效率相比上一代K2提升了约2.5倍。换句话说,同样投入1块钱算力,K3能转化出2.5倍于K2的能力。
三、实测表现:离全球最强还有多远?
在正式发布前,K3曾以"Kivine"的匿名身份出现在LMArena竞技场,引发了圈内广泛关注。多位测试者发现Kivine在生成网页、3D场景和小游戏方面表现出色,甚至被直接称为"Fable级"。
根据月之暗面公布的官方评测数据:
| 评测项目 | Kimi K3 | Claude Fable 5 Max | GPT-5.6 Sol Max | Claude Opus 4.8 Max |
|---|---|---|---|---|
| GDPval-AA v2(综合职业任务) | 1687分 | 第一 | 第二 | 1600分 |
| AA-Briefcase(长程智能体知识工作) | 1527分(第二名) | 第一名 | 1495分 | — |
| BrowseComp(信息检索) | 91.2分 | — | — | — |
从数据来看,K3的综合智能水平仅次于Claude Fable 5和GPT-5.6 Sol,在部分任务上甚至超过了GPT-5.6 Sol Max。尤其值得注意的是:
- 编程能力突出:K3被定位为"公司迄今编程能力最强的模型",可以持续处理长周期软件工程任务,理解大型代码库,操作终端,协调工具调用
- 视觉+代码结合强:在源代码和渲染结果之间来回切换,结合截图、日志判断下一步修改方向,特别适合游戏开发、前端工程、CAD工作流
- 长上下文优势明显:BrowseComp信息检索91.2分由单个智能体完成,未使用上下文压缩或额外管理技术
实际用户测试反馈
在LMArena上的匿名测试中,K3(Kivine)展现出了一些独特特点:
✅ 主动扩展任务范围:提示词只要求制作静态世界,K3会交付一个可以实时运行的动画场景;要求做《我的世界》风格游戏,最终做成了带音效、光影和虚拟摇杆的完整寻宝游戏。
⚡ 前端生成质量高:多次被用户评为"同一提示词下见过的最好结果之一",但也有用户反映生成时间较长(约20-35分钟)。
🎮 游戏/3D场景表现亮眼:马里奥赛车碰撞物理模拟、3D盆景生成等任务中,运动流畅度据称超过GPT-5.6 Sol。
四、定价策略:国产模型首次对标国际旗舰
Kimi K3的API定价引起了行业关注——这是第一次有国产模型在公开API定价上,直接站进国际旗舰的价位带。
| 模型 | 输入(缓存命中) | 输入(未命中) | 输出 |
|---|---|---|---|
| Kimi K3 | ¥2/百万token | ¥20/百万token | ¥100/百万token |
| Claude Fable 5 | 约¥72 | 约¥72 | 约¥360 |
| GPT-5.6 Sol | 约¥36 | 约¥36 | 约¥216 |
| GPT-5.6 Terra | 约¥18 | 约¥18 | 约¥108 |
K3的输入价格(约2.8美元/百万token)几乎贴着GPT-5.6 Terra,是Claude Fable 5的三分之一左右。过去国产模型的打法是"性能打八折,价格打一折",K3则标志着月之暗面对自身定位的升级——不再走低价路线,而是以接近国际旗舰的价格提供接近国际旗舰的性能。
C端会员方面,Kimi推出了五档订阅(Adagio免费 / Andante ¥49 / Moderato ¥99 / Allegretto ¥199 / Allegro ¥699),K3模型需要Moderato及以上会员才能使用,最高支持1M上下文。
五、怎么用上Kimi K3?
目前K3已经通过以下方式开放:
1. 网页版/客户端
访问 kimi.com,选择模型K3即可使用。但需注意网页版可能不是满血版本——有媒体实测复杂任务耗时较长,完整体验建议使用Kimi Code或API。
2. API接入
通过 platform.kimi.com 申请API Key,模型名为 kimi-k3,兼容OpenAI SDK协议。官方已提供接入Claude Code、Codex、Cline等工具的指南,现有工具链无需修改。
3. Kimi Code
Kimi官方IDE,按会员档位分配K3使用额度。已在使用的用户可无缝切换。
六、K3的价值判断:谁应该关注?
✅ 适合这些场景
- 重度长上下文任务(大仓库代码分析、长文档处理)
- 前端开发和游戏/3D场景生成
- 需要视觉+代码结合的工作流(CAD、前端调试)
- 长周期智能体知识工作
- 缓存命中场景下的高性价比API调用
⚠️ 需要留意的点
- 生成速度偏慢(20-35分钟/复杂任务)
- 尚未正式发布开源权重(目前仅API)
- 网页端非满血版本
- 独立评测榜单尚未收录,"超越谁"的说法需理性看待
- C端使用门槛较高(需Moderato以上会员)
七、行业意义:开源模型的里程碑时刻
Kimi K3的发布,对AI行业有几个重要信号:
第一,开源模型首次具备与顶级闭源模型正面竞争的实力。过去开源模型的优势主要在"免费"和"可定制",性能上始终落后闭源旗舰一到两代。K3是第一个在综合评测中接近全球最强闭源模型的开源产品,虽然还有差距,但"半步之遥"已经是历史性的突破。
第二,月之暗面的商业化路径清晰化。年内完成6轮融资,估值突破300亿美元,ARR突破3亿美元且API收入占比超七成。K3定价策略从"性价比"转向"价值对标",说明月之暗面已经不再满足于追赶者角色。
第三,WAIC 2026的完美预热。K3选择在大会开幕前夜发布,与华为Atlas 950超节点、MiniMax M3、300+全球首发产品等一起,构成了本届WAIC最具话题性的技术看点。正如大会主题"智能伙伴 共创未来"所暗示的,中国AI正在从单点突破走向群体崛起。
· 人民日报《参数规模达2.8万亿,全球最大规模开源模型发布》(2026-07-17)
· 上海证券报《2.8万亿!月之暗面发布最新开源模型》(2026-07-17)
· 36氪《月之暗面正式推出开源模型Kimi K3》(2026-07-17)
· 凤凰科技《Kimi发布史上最大开源模型!参数高达2.8T》(2026-07-17)
· 博客园《Kimi K3来了,2.8万亿参数、1M上下文》(2026-07-17)
· Kimi开放平台官方文档 platform.kimi.ai