月之暗面发布Kimi K3技术报告开放模型权重 总参数达2.8万亿
7月27日晚,月之暗面正式发布Kimi K3技术报告,并同步开放完整模型权重。
性能表现与适配进展
作为总参数达2.8万亿、激活参数约1040亿的大模型,Kimi K3凭借核心架构原始创新,在多项评测中展现出逼近全球顶尖闭源模型的性能。
7月28日,K3模型即获海内外数十家AI基础设施厂商的首日(Day0)适配,引发了全球开发者社区的强烈反响。
商业化规则与技术架构
值得注意的是,Kimi K3采用了专门的许可证,为商业化应用设定了门槛。
技术底座较上一代Kimi K2有明显变化,核心架构设计包括三项技术:Kimi Delta Attention(KDA)指一种优化注意力计算的架构设计;Attention Residuals(AttnRes)为注意力残差连接机制;Stable LatentMoE框架指稳定的潜变量混合专家模型。
训练效率实现跃升
- Kimi Delta Attention(KDA)通过改进计算路径提升处理速度
- Attention Residuals(AttnRes)增强模型稳定性与信号传递
- Stable LatentMoE框架优化资源分配与推理效率
这一开放策略可能促进AI技术的普惠应用,推动开发者社区对开源模型的整合与创新实践。

Kimi K3开源模型训练成本降低50%推理成本仅为闭源模型38%
月之暗面最新披露Kimi K3大模型技术参数与评测数据表明,该模型通过自研架构在保持顶尖性能的同时显著降低运行成本。技术报告显示,训练效率提升2.5倍,开源后接待多家厂商Day0级适配。
核心技术创新细节
KDA线性注意力机制将传统Transformer的KV缓存替换为固定大小循环状态,在1M上下文窗口下维持较低计算开销。Attention Residuals技术实现逐层表征选择性检索,优化信息传输效率。MoE架构扩展至896个专家,单token激活16个,配合2个共享专家达成56倍稀疏比例。
月之暗面企业业务负责人黄震昕介绍,团队自研Moon Clip二阶优化器使训练数据需求减半:40T数据原需效果可降至20T数据量。该技术在全球首次应用于大模型训练,解决优质数据挖掘殆尽问题,实现有限数据激发更高智能水平,训练成本与计算量同步减半。
在研究生级科学问答GPQA Diamond中,Kimi K3得分93.5%,落后于GPT-5.6 Sol的94.1%,略高于Claude Fable 5的92.6%。
评测表现与成本优势
编程能力评测显示Kimi K3在ProgramBench以77.8%居首,在SWE-Marathon面向GPU内核优化测试中达42.0%,领先Claude Fable 5的35.0%。视觉编码器MoonViT-V2采用4亿参数Transformer,从头训练提升训练稳定性与评测结果。
成本效率表现突出:Kimi Code Bench 2.0上得分低于Claude Fable 5约4个百分点,但推理成本仅为后者38%。BrowseComp评测中每任务成本仅2.03美元即获最高分,证明开源模型可实现高性价比运行。
- Artificial Analysis智能指数v4.1中以57.1分列第四
- Vals AI行业基准74.7%排名第二
- WebDev Arena以1678 Elo登顶,成首个登顶的开源模型
开源生态部署进展
开源当日多厂商完成适配:阿里云真武M890超节点实例首日跑通近3万亿参数模型,优化后首token时延降35%,单卡解码吞吐提升1.8倍。华为昇腾提供全链路支持,覆盖训练复现与推理部署。
海外基础设施厂商如Nebius、Baseten同步响应,vLLM与SGLang两大框架首日支持部署。北美创企Cognition宣布接入Devin工具,并指出其在FrontierCode 1.1评测中为"首款性能逼近前沿的开源模型"。
商业许可协议设计
模型采用分层许可机制:基础层支持免费商用,但若模型即服务业务连续12个月收入超2000万美元需签署额外协议;产品月活超1亿或月收入超2000万美元时须显著标识模型名称。
业内分析指出,该设计形成梯度商业化路径——底层开发者免费使用,中型企业通过官方API按token付费,超大客户则签署包含收入分成、品牌露出、技术支持等条款的专属协议。同时明确内部使用及通过月之暗面官方产品访问不受限制。
黄震昕表示开源与闭源不存在非此即彼的对立,开源满足私有化部署与微调需求,闭源专注顶级模型性能,中国自研开源大模型无需卷入价格战。
行业测算显示,当云厂商单条大模型API年收入跨过2000万美元门槛后,边际成本陡降触发毛利率转正。开放权重后以API形式售卖,定价可较官方低20%至40%。多家厂商据此调整部署策略,加速面向中小企业普及。
