首页 / 科技 / 月之暗面Kimi开源Kimi K3模型权重及关键技术

月之暗面Kimi开源Kimi K3模型权重及关键技术

摸鱼不慌
摸鱼不慌

近日,人工智能领域参与者@月之暗面Kimi对外发布Kimi K3的模型权重及相关技术报告,并公开了几项支撑模型训练的核心技术组件。

公开内容与开源组件

Kimi K3模型的主要权重文件已由发布方上线,同时伴随的技术报告详细记录了训练过程中的关键方法和结果。此外,支持该模型训练的三项核心技术——MoonEP、FlashKDA和AgentEnv——也被作为开源项目对外发布。

技术组件简介

MoonEP是一种用于提升并行计算效率的基础设施技术,FlashKDA则是一种优化的数据处理加速算法。AgentEnv则是一个用于模型训练的特定环境配置工具。这些技术的开源旨在为行业提供参考实现。

发布背景与行业影响

此次开源行动反映出发布方在人工智能技术领域的开放态度,通过分享模型权重和核心技术,为行业内的研究者和开发者提供了宝贵资源。业内人士指出,此类开源举措将有助于推动相关技术领域的透明度和协同发展。

月之暗面Kimi开源Kimi K3模型权重及关键技术  第1张

Kimi K3模型公开发布:2.8万亿参数混合专家能力开放

据CNMO科技消息,月之暗面旗下Kimi K3模型正式向公众发布。该模型具备原生视觉理解和超长上下文处理能力,现支持自由下载与部署。

模型核心参数与特性

Kimi K3是月之暗面当前参数规模最大的模型版本,参数总量达2.8万亿,采用混合专家(MoE)架构。

混合专家(MoE)模型是一种通过将任务分配给多个专家子网络来提升处理能力的机器学习架构。

该模型原生支持图像识别与理解,并可实现100万token的上下文窗口,远超行业普遍水平。

开放下载与部署

用户可从官方渠道获取模型文件,支持应用范围包括但不限于内部研发实验或商用产品集成。

自由使用授权

CNMO科技提到,模型的使用无附加限制条件,各方可根据需求应用于不同场景,为终端用户提供相应功能。

Kimi K3的高参数量与MoE架构相结合,在多模态交互领域具备明显优势,企业可以直接获取并应用于解决复杂认知任务。

月之暗面Kimi开源Kimi K3模型权重及关键技术  第2张

Kimi K3模型权重及技术报告公开 自动化模型构建能力提升

与Kimi K3模型权重一起公开的,还有模型训练方法——Kimi K3技术报告已同步上线,详细介绍了KDA+AttnRes、Stable LatentMoE、MoonViT-V2等技术细节。

长上下文建模新突破

KDA+AttnRes是一种以3:1比例混合KDA与Gated MLA的技术方案,旨在实现高效长上下文建模。通过块级注意力残差,该方案增强了跨层信息流动,为模型训练提供了更多灵活性。

KDA+AttnRes将模型训练中的KDA与Gated MLA按3:1比例混合,通过块级注意力残差增强信息流动。

高稀疏度训练稳定方案

Stable LatentMoE技术中,每个token能够从896个路由专家中激活16个。该方案结合SiTU-GLU与Quantile Balancing机制,确保了在极高稀疏度下的训练稳定性,避免了模型训练中的不稳定性问题。

MoonViT-V2作为视觉编码器,采用了从零开始的next-token prediction训练方法,无需对比预训练。该方法在达到SigLIP初始化基线效果的同时,获得了更稳定的优化过程,简化了模型训练的复杂度。

多领域评估体系完善

后训练与评估环节涵盖了通用推理、通用Agent和编程Agent三大领域。通过大规模任务合成和百万token上下文的强化学习基建,该模型完成了近20个内部评测集的完整评估,确保了模型在多场景下的适用性和可靠性。

此次Kimi K3模型权重及技术报告的公开,不仅为研究者提供了更深层次的模型构建思路,也为自动化模型构建能力提升了新的标准。行业专家指出,这些技术的应用将进一步推动人工智能模型的发展。