MiniMax多模态生成模型开源 摩尔线程完成适配
国内AI企业MiniMax今日宣布开源多模态生成模型H3。根据公告显示,该AI系统支持图像和文本生成。与此同时,芯片制造商摩尔线程宣布其AI训推一体智算卡MTT S5000已完成兼容该开发平台。
计算力突破的新探索
MUSA软件架构与新一代AI计算平台正逐步构建起完整的国产算力生态。在最新发布的24英寸AI训练工作站中,研发团队采用了六路交叉互联的结构设计。
- 集成36个独立核心处理器
- 并行计算总能力达到3.8EFLOPS
- 支持多种AI模型的实时编译
硬件适配层展现出良好的接口开放性,兼容深度学习主流框架,为多模态计算提供硬件基础。
多模态基础模型解析
据介绍,H3模型通过16层Transformer结构建立了跨模态特征映射。这种设计使文字描述与图像处理能够进行协同计算,形成统一的语义系统。
- 支持文中图像识别与生成
- 语言理解与生成
- 表格数据处理
模型开发者表示,后续计划在视频生成领域进行扩展,在保持训练效率的同时注重能耗控制。
"H3是领先的多模态系统,"技术负责人强调,"它的设计确保高效率计算的同时兼顾创新性。

【MiniMax开源全模态生成系统H3实现多模态理解与生成】
MiniMax今日正式开源其H3全模态生成系统。该系统具备统一处理文本、图像、视频及音频的能力,能够整合多模态上下文信息,并生成最高2K分辨率、时长15秒的视频,同时支持原生立体声音频输出。
本次开源覆盖了H3模型的权重数据,并开放了本地部署权限及完整的流程验证支持,允许开发者直接在本地运行并验证系统功能。
作为一套通用型生成系统,H3突破了传统单一模态的限制,能够同时"理解"文本、图像、视频以及音频之间的复杂关系,并基于这些多模态数据生成高质量的多媒体内容。目前系统默认生成的视频时长可容纳15秒,分辨率达到2K标准,音频输出支持立体声,确保生成内容的沉浸式体验。

MiniMax H3系统多模态架构支持高清视频生成
MiniMax公司近日对外发布H3系统,这是一个面向AI视频生成的多模态框架。该系统基于开源授权提供,旨在简化开发者部署流程。其核心设计整合了文本、图像、视频和音频的统一编码与预测功能。
系统模块划分
整个H3系统由三个关键模块构成:H3-Context-Information Retrieval负责用户输入的多模态指令转换为结构化表示;H3-Base作为主开源部分,能够生成768p分辨率音视频内容;H3-Regenerate-2K模块则通过API接口,以2K分辨率重新生成更高画质版本,但当前尚未公开源代码。
H3-Base采用H3-Omni-Transformer架构,该架构拥有330亿参数量,整合视觉和音频编码器用于多模态序列联合预测。体系内包含H3-VisualVAE和H3-AudioVAE组件,分别处理视觉与音频信息压缩。官方提供了两个主要版本,针对文生视频、首尾帧生视频,支持多图像、多视频和多音频混合输入,适用于人物与场景保留、动作和嘴型编辑等特定应用场景。
在语言支持方面,H3系统覆盖中文、英语、日语、韩语等11种语言,便于国际化开发环境。开发者可借助SGLang、vLLM、diffusers、ComfyUI等框架进行本地部署或构建完整2K工作流,依靠H3-Base本地部署选项实现高效推理。
值得一提的是,H3系统的基于MiniMax H3 Community License分发,这标志着公司将开源资源开放给研发社区,进一步扩展AI视频生成效能。
