英特尔锐炫Pro B70首发适配MiniMax H3 多卡GPU部署方案实现视频生成加速
8月3日消息,英特尔今日宣布为新一代开源多模态视频模型MiniMax H3提供Day 0首发支持。英特尔锐炫Pro B70第一时间完成对MiniMax H3的适配,并推出基于多卡GPU的部署方案,覆盖视频生成全流程的GPU加速。
基于多卡并行架构的部署方案
英特尔团队实现的部署方案采用Encoder 8卡张量并行(8TP)、DiT 8卡USP(Ulysses Sequence Parallel)并结合Layer-wise Offloading,以及VAE部署于B70 GPU的整体架构。
其中,Encoder通过8卡张量并行完成文本编码。DiT作为推理过程中计算量最大的模块,采用8卡USP并结合Layer-wise Offloading技术。该技术使模型参数按层动态加载到GPU,用以突破单卡显存限制、降低模型常驻显存需求,支持更大规模DiT模型的部署。VAE则部署于B70 GPU上完成最终的视频解码。
混合并行方案减少通信开销
为兼顾模型容量与计算效率,团队进一步结合张量并行与USP的优势,开发了2TP×4USP的混合并行方案。该方案将USP并行度由8降至4,并引入2路张量并行对计算进行协同加速。
据介绍,这一方案在保持模型扩展能力的同时,减少USP带来的通信开销,实现计算负载与通信开销之间更优的平衡,从而进一步提升整体推理性能。
算子优化与低时延推理
此外,结合llm-scaler-omni项目的XPU Kernel优化,团队对矩阵乘法、注意力等关键算子进行了持续优化。通过提升GPU的计算效率,持续降低端到端推理时延,取得了良好的优化效果。
英特尔表示,该方案兼顾了模型容量与计算效率,为大规模视频生成模型提供了更具扩展性的部署方式。
