国产算力里程碑!摩尔线程MTT S5000跑通美团万亿参数LongCat-2.0模型
🎯 事件始末:Day-0极速适配
2026年7月6日,美团正式开源新一代万亿参数大模型LongCat-2.0。几乎同一时间,国产GPU厂商摩尔线程宣布,基于其AI训推一体全功能GPU智算卡MTT S5000及MUSA软件栈,已完成对该模型的Day-0极速适配。
🔥 核心要点
这是业界首个完全依靠国产算力完成训练和推理全流程的万亿参数大模型。LongCat-2.0在五万张国产算力卡上完成预训练,数据规模超过30万亿Tokens,标志着国产GPU生态的重大突破。
此次适配覆盖模型加载、推理引擎拉起、关键算子优化、部署验证与精度校验等全链路环节,使LongCat-2.0能够在MTT S5000上实现稳定、高效的推理运行。同日,华为昇腾、沐曦股份等国产芯片厂商也集体宣布完成对该模型的推理适配。
🧠 LongCat-2.0模型解析
模型规格
| 参数指标 | 数值 |
|---|---|
| 总参数量 | 1.6万亿(1.6T) |
| 平均激活参数 | 约480亿(48B) |
| 动态激活范围 | 33B ~ 56B |
| 上下文长度 | 原生支持1M(100万)Token |
| 架构类型 | MoE(混合专家) |
| 训练数据 | 超过30万亿Tokens |
| 训练规模 | 五万张国产算力卡 |
核心技术创新
LongCat-2.0专为Agentic Coding场景设计,引入了多项创新技术:
- LongCat稀疏注意力机制(LSA):通过流感知索引、跨层索引和层级化索引策略,将长上下文计算量从平方级降至线性级,大幅提升百万级上下文的训练与推理效率
- N-gram Embedding:在MoE专家之外引入新的参数扩展路径,将135B参数投入该模块,在MoE稀疏度接近97%的情况下进一步强化代码理解与生成能力
- ScMoE跨层快捷连接架构:利用国产芯片的控核能力,让Dense与MoE分支实现物理核心级并行执行,压缩端到端延迟
- 零计算专家动态激活机制:简单token不消耗算力,复杂token自动获得更多计算资源,实现资源的高效利用
💻 MTT S5000硬件能力
摩尔线程MTT S5000是业界首款AI训推一体全功能GPU智算卡,搭载自研PH100芯片,具备以下核心能力:
- 硬件级原生FP8加速:支持从FP4到FP64的全精度端到端计算,算力密度提升50%
- 高算力、大容量显存与高带宽:为长上下文输入、KV Cache读写和高并发推理提供稳定支撑
- MUSA软件栈:自主元计算统一架构,覆盖从芯片架构、指令集、编程模型到软件运行库的全栈技术体系
- SGLang-MUSA推理引擎:针对LongCat-2.0的模型结构和推理特性,快速完成从框架兼容到性能优化的全链路适配
结合SGLang-MUSA推理引擎与MUSA软件栈的协同优化,LongCat-2.0在MTT S5000上能够更充分释放推理性能,提升在线服务响应效率与系统吞吐能力。
🚀 技术突破:国芯+国模全栈协同
LongCat-2.0的成功,不仅是模型本身的突破,更是国产算力生态全栈协同的验证。针对显存与带宽受限的国产算力芯片,LongCat团队从三个方向进行了深度协同优化:
1. 模型层面优化
- Attention通过absorb计算模式、Indexer与MLA prolog并行处理以及KVP切分KV-cache,有效缓解超长上下文的I/O与显存压力
- ScMoE利用国产芯片控核能力,让Dense与MoE分支实现物理核心级并行执行,压缩端到端延迟
2. 芯片适配层面
- 通过Super Kernel减少算子数量以降低启动开销
- 以Weight Prefetch将I/O延迟隐藏在前序计算中
- 基于高速片间互联完成layer-wise的KV-cache传输,在受限的显存和带宽条件下将硬件利用率最大化
3. 部署策略层面
- 采用PD分离部署兼顾TTFT(首Token延迟)与TPOT(每个输出Token生成时间)
- Prefill端通过缩小Expert-Parallel域与序列并行分担长序列计算压力
- Decode端以KV-cache切分与高并行度降低单卡显存占用
- 配合异步化Expert-Parallel Load Balancing解决大EP度下的负载不均
🌍 行业影响与意义
1. 验证国产算力承载复杂大模型的能力
LongCat-2.0证明了国产芯片已经具备承载万亿参数级别复杂大模型任务的能力。从训练到推理的全流程闭环,标志着国产GPU生态从"能用"走向"好用"。
2. 盘活存量国产算力
美团此次开源同步提供BF16、FP8及INT8等多精度版本,全面覆盖不同算力平台的部署需求。美团表示,希望以开源为纽带,盘活存量国产算力,让更多国产卡包括老卡都能流畅部署万亿大模型推理服务,释放国产算力生态的长期价值。
3. 推动"国芯+国模"协同研发
行业分析人士认为,LongCat-2.0的开源为国产算力厂商提供了全新的万亿参数级真实测试场景,将有效激活存量国产芯片。"国芯+国模"的协同研发,正从单点突破向规模化推进。
4. 降低开发者使用门槛
LongCat-2.0采用MIT协议开源,允许免费商用。开发者可以通过GitHub、HuggingFace和ModelScope获取模型权重和推理代码,快速部署和使用。
📊 国产GPU生态对比
目前,国内主要GPU厂商都在积极适配LongCat-2.0等前沿大模型:
| 厂商 | 代表产品 | 适配情况 | 核心优势 |
|---|---|---|---|
| 摩尔线程 | MTT S5000 | Day-0完成LongCat-2.0适配 | 全功能GPU,支持FP4-FP64全精度,MUSA软件栈成熟 |
| 华为昇腾 | 昇腾910系列 | 迅速完成适配 | 生态完善,万卡集群经验丰富,CANN推理框架成熟 |
| 沐曦股份 | 曦思N系列 | 同日宣布完成适配 | 专注AI推理,性价比优势 |
多家厂商同步适配,说明国产GPU生态正在从单点突破走向百花齐放,开发者有了更多选择。
🔮 未来展望
对开发者的建议
- 关注国产算力生态:随着LongCat-2.0等模型的开源,国产GPU的可用性和性价比将持续提升,值得关注和尝试
- 尽早布局Agentic Coding:LongCat-2.0专为Agentic Coding场景优化,在代码理解、生成和执行方面表现优异,是未来AI编程的重要方向
- 利用多精度版本灵活部署:根据硬件条件选择BF16、FP8或INT8版本,在性能和资源占用之间找到平衡
对行业的影响
LongCat-2.0的开源和国产算力的成功适配,将产生以下深远影响:
- 加速国产算力商业化:更多企业将敢于采用国产算力进行大模型训练和推理,降低对海外硬件的依赖
- 推动AI应用落地:万亿参数模型的普及将推动AI Coding、Agent工作流、企业知识库等应用场景的快速发展
- 促进开源生态繁荣:MIT协议的开源方式将吸引更多开发者参与,形成良性循环
🎯 总结
美团LongCat-2.0的开源和摩尔线程等国产GPU厂商的Day-0适配,标志着国产算力生态的重大突破。这不仅是技术层面的成功,更是产业链协同创新的典范。对于开发者和企业而言,这意味着有了更多可靠、高性能的国产算力选择,AI应用的未来将更加多元化和本土化。
📎 相关链接
- LongCat-2.0官方博客:https://longcat.ai/blog/longcat-2.0/
- 模型权重(HuggingFace):https://huggingface.co/meituan-longcat/LongCat-2.0
- GitHub仓库:https://github.com/meituan-longcat/LongCat-2.0
- ModelScope:https://www.modelscope.cn/collections/meituan-longcat/LongCat-20
- API平台:https://longcat.chat/platform/product