昆仑万维发布Matrix-Game3.5世界模型 方汉称2026年为“世界模型元年”
7月19日,2026世界人工智能大会(WAIC)期间,昆仑万维在上海西岸国际会展中心举办“世界模型与多模态范式跃迁”专场论坛,宣布旗下三款核心模型升级。
三款模型全面升级
此次发布的模型包括Matrix-Game3.5世界模型、Mureka v9.5与O3音乐模型,覆盖世界模型与AIGC创作两大前沿赛道。其中,Matrix-Game3.5被视为昆仑万维在物理世界模拟领域的重要成果,Mureka v9.5和O3则聚焦音乐生成,进一步拓展AI创作能力。
“2026年为‘世界模型元年’,标志着AI从内容生成走向对物理世界的理解与交互的关键转折。”——昆仑万维董事长兼CEO方汉
世界模型解析
依据方汉的表述,世界模型是指能够理解物理世界规律并与之动态交互的AI系统,区别于当前主流的文本、图像生成模型。论坛期间,昆仑万维展示了从内容生成向物理世界理解转型的技术路径。
作为深耕AI领域的科技企业,昆仑万维此次在WAIC集中发布多模态升级,反映出业界对AI下一阶段发展范式的探索。论坛吸引了众多与会者关注,现场讨论了世界模型在具身智能、模拟环境等场景的潜在应用。

昆仑万维方汉宣布2026年为“世界模型元年” AI核心转向理解与交互
在论坛主旨演讲环节,昆仑万维董事长兼CEO方汉正式提出2026年将成为“世界模型元年”。他指出,过去两年人工智能行业的重点在于“生成”——生成文字、图像、视频、音乐。而从2026年开始,AI的核心命题将转向“理解”与“交互”。
AI命题从生成跨越到理解
方汉回顾了过去两年AI发展的重心,即利用算法创造各类数字内容。随着技术演进,他认为新的阶段要求AI真正理解物理世界的运行规律,并能够与真实环境进行闭环互动。这一转变意味着AI将从符号处理迈向现实场景的感知与行动。
世界模型:技术底座的定义
方汉将世界模型定位为实现上述跨越的关键技术底座。它的核心目标是让AI系统掌握物理规律,并通过感知与执行在现实中形成闭环。这与当前以内容创作为主的生成式AI有本质区别——后者擅长处理文字、图像、视频、音乐,而前者直面物理世界的复杂性。
“过去两年AI行业的核心命题是‘生成’——生成文字、图像、视频、音乐。而从2026年开始,AI的核心命题将转向‘理解’与‘交互’。” —— 方汉
方汉的预判为AI产业的技术演进提供了新的方向。他强调,世界模型不仅是技术概念,更是推动AI从虚拟走向现实、从观察走向行动的桥梁。行业观察人士指出,这一思路可能重新定义未来AI应用的边界与可能。
图为昆仑万维董事长兼CEO方汉
方汉在演讲中系统阐述了三大产业预判:
第一,世界模型将走出屏幕,进入物理世界。我们洞察到,具身智能正从实验室走向真实环境,这一趋势要求机器人在行动前先进行环境推演——预判动作后果、评估环境变化、及时调整应对策略。这种能力的突破,将使竞争焦点从单一任务转向陌生环境下的通用模型能力;谁能训练出在复杂场景中依然“看得懂、做得对”的模型,谁就拿到物理智能时代的入场券,这也是中国智能制造和机器人产业真正亟需的底层能力。
第二,游戏行业将率先被世界模型改变。开放世界游戏不再依赖数百人团队数年的手工搭建,Matrix-Game3.5让虚拟世界随玩家行动实时生长、持续演化。未来三到五年,世界模型将成为游戏行业的基础设施,彻底刷新内容生产方式,而国产模型已在这一赛道领跑全球。
第三,AI音乐、AI视频等工具将从技术试验变成大众创作工具,促进 AIGC的深层发展。 Mureka作为中国最强、全球前两名的音乐生成模型,率先去除“AI味”,让普通人也能把模糊灵感转化为有情绪、有温度的作品。这并非替代音乐人,而是大幅降低创作门槛,让更多人的表达得以释放,从而根本性改变音乐乃至整个 AIGC产业的创作生态。
三个产业预判,背后是同一个方向:让AI从“会生成”走向"懂世界"、"能行动"。方汉表示,这不只是昆仑万维一家公司的回答,更是中国AI从研发走向产业应用的一个缩影。
AI模型全球升级,掀起全模态内容生成革命
本次论坛上,昆仑万维集中完成了核心模型的全球重磅升级。
Matrix-Game3.5:Patch级记忆注入,重新定义交互世界模型
作为昆仑万维世界模型系列的最新迭代,Matrix-Game3.5在本次论坛上带来了革命性的技术升级。
Skywork首席科学家成宇在论坛上正式发布了Matrix-Game3.5世界模型。Matrix-Game3.5聚焦可交互世界模型技术,实现了Patch级别的记忆注入与系统级性能优化,5B模型在720p分辨率下可实现单卡20FPS实时生成,具备1分钟记忆能力。
昆仑万维发布Matrix-Game3.5与Mureka v9.5&O3 实现实时世界模型与自然音乐生成
近日,昆仑万维旗下AI团队在论坛上发布了新一代世界模型Matrix-Game3.5及音乐大模型Mureka v9.5&O3。
Matrix-Game3.5:具身智能的无限数据引擎
Skywork首席科学家成宇指出,传统数据采集面临人工成本高昂、实机采集耗时耗力等痛点,无法满足大模型规模化需求。
Matrix-Game3.5构建了三条自动化数据生产管线,输出Video+Pose+Action+Language高质量训练数据。
目前已积累超500万高质量视频切片、超1万有效训练小时数,覆盖1200余个游戏场景。
Patch-level空间记忆增强长期一致性
在技术架构上,Matrix-Game3.5创新性地将历史帧切分为带有3D坐标的Patch Memory(通过Depth+Pose Lift到世界坐标系)。
推理时根据当前相机视锥检索可见Patch并重新投影到当前视角形成Mosaic,再作为Memory Token注入DiT。
这一设计将Frame-level FOV Memory升级为Patch-level FOV Memory,带来四大核心优势:
- 更准确的空间记忆检索与跨帧一致性
- 更稳定的相机运动生成
- 最大化保留基座模型动态生成能力的In-context Learning
- 用户可自由编辑记忆块的可控记忆能力
全链路优化实现单卡20FPS 720p实时推理
Matrix-Game3.5在推理加速层面实现了DiT推理与VAE解码的全链路优化,通过“减少模型吞吐+DiT模型优化+VAE剪枝”三重手段,达成单卡20FPS 720p实时推理的业界领先性能,让高质量世界模型具备实时交互能力。
Mureka v9.5&O3:追求自然真实的音乐生成
从SkyMusic1.0内测到Mureka v9.5&O3,昆仑万维的音乐模型走过了一条从“作品成立”到“创作可控”再到“多模态创作”的演进路径。
v9.5首次喊出“最没有AI味的AI音乐模型”口号,不依赖声部堆砌,以克制方式处理编配、人声、情绪与Prompt意图,使音乐表达更自然真诚。
O3模型引入持续自我修正机制
O3建立于v9.5之上,通过test-time scaling扩展MusiCoT的推理过程。模型持续审视当前表达,进行局部旋律是否服务全曲目标等检查,使音乐CoT逐步收敛,而不是一次决定后一路向前。
开源路线与国际认可
Matrix-Game从1.0到3.5始终坚持开源路线,3.5版本宣布核心架构开源,吸引全球开发者共建生态。
此前,DiT作者、纽约大学助理教授谢赛宁团队基于Matrix-Game2.0发布全球首个多人视频世界模型Solaris;NVIDIA和浙大基于3.0研发Light Interaction;NVIDIA的SANA-WM和Adobe的RELIC等国际头部大厂世界模型均将Matrix-Game相关模型作为对比基准。

Mureka升级V9.5与O3模型 指令精准度提升7.62 版本化制作平台上线
从评测结果来看,Mureka V9.5模型在旋律、人声、音质和编曲方面完成底座升级,指令精准度从6.92提升至7.62。O3模型则建立在V9.5之上,通过持续推演和修正决策,进一步强化旋律发展与指令理解。这一升级不再以“更满更复杂”为标准,而是在真实音乐框架中更克制地处理编配与情绪。
音乐与视频MV创作链路打通
此次升级将音乐与视频MV接入同一条创作链路。用户可从一张图、一段视频或moodboard开始,让系统理解画面的节奏、人物与情绪,生成匹配音乐;也能从一首歌开始,让Agent理解歌词叙事与编曲结构,生成角色与MV视觉方案。歌词决定叙事、节拍决定剪辑、旋律决定记忆点、画面决定传播场景,Agent使这些信息在同一目标下持续传递。
版本化制作平台与功能拆解
Mureka已从单一音乐生成工具演进为完整的“版本化制作”平台。平台由“模型训练—推理时选优—版本化创作—分发”构成系统组合。同一创意可快速生成多版本,支持旋律、人声、结构等维度的局部保留与替换;Studio将操作DAW转化为指挥创作,降低门槛、抬高上限。
所谓版本化制作,是指创作者在同一创意基础上通过多次生成和局部调整,快速迭代不同版本的作品,而无需从零开始。
Mureka还推出Character功能——一段声音和一张照片即可生成专属歌手角色,并贯穿歌曲、MV全链路。AI配乐能自动分析视频画面的场景、动作与情绪,创作更匹配的音乐。Mureka Agent通过自然语言一次对话调用整曲生成、单轨生成、Remix、延伸、MIDI导出、声音克隆等全部能力,全程无需切换界面。
愿景:从消费内容到表达语言
昆仑万维提出,AI音乐不再是简单的消费内容,而是升级为自我表达的语言。用户从被动聆听者转变为主动表达者与参与者。Mureka正以模型能力、创作工具与平台分发的闭环,重新定义AI时代的音乐创作生态,让“一个想法”到“歌词—人声—角色—歌曲—MV”的完整链路落地。
论坛聚焦世界模型前沿
在本次论坛上,中国科学院院士周志华受邀发表主旨演讲,围绕世界模型前沿方向展开分享。黎曼动力机器人创始人刘扬教授介绍了黎曼机器人模型1.0版,Reactor Technologies, Inc. CEO Alberto Taiuti分享了加速世界模型在全球落地的经验。
图为中国科学院院士、南京大学教授、副校长周志华
中国科学院院士、南京大学副校长周志华教授在题为《关于世界模型的讨论》的主旨演讲中,将世界模型划分为感知层、理解层与决策层,并着重指出决策层世界模型长期面临“多步推演复合误差平方级放大”与“样本复杂度过高”两大理论瓶颈。
他分享了团队的最新突破:通过分布匹配技术可将推演误差从平方级压至线性级,验证了长序列推演的可行性。同时,通过创新性地逆向运用贝尔曼方程,将所需样本量降至原来的根号T分之一,为在战斗机操控、智能工厂等代价高昂的现实任务中构建决策世界模型提供了理论基础。他还提出“学件”概念——由模型与AI自动生成的“规约”共同构成,允许多个异构模型在不公开数据的前提下进行复用与组装,为世界模型从单产线定制走向可成长、可演化的模型生态开辟了新路径。
图为黎曼动力机器人创始人刘扬教授
黎曼动力机器人近期推出的 Riemann-1.0,是其成立以来首个公开发布的成果——面向 Physical AI的新一代 Embodied World Action Model。该模型基于超过23.2万小时多源具身交互数据训练,统一融合第一视角人类视频、UMI示教与异构机器人轨迹,并提出全因果世界动作建模架构与三阶段渐进式具身预训练框架。Riemann-1.0不再停留于仿真环境中的离线评估,而是在多个国际主流机器人 Benchmark与真实机器人任务上同步实现仿真与真机双 SOTA,为机器人操作、实时自适应控制及高频人机协作等 Physical AI场景提供了从“理解世界”到“干预世界”的生成式行动基础设施。
Reactor Technologies, Inc. CEO兼联合创始人Alberto Taiuti则从产业落地角度指出,世界模型已从静态、高延迟、无状态的媒体生成范式,跃迁至有状态、实时交互、具备因果逻辑的新范式。他强调,世界模型不再只是生成视频或图像,而是能够持续推演环境变化并支持双向人机交互的“生成式软件”雏形。他以公司同名平台“Reactor”为例,展示了为世界模型原生设计的开发者基础设施如何在保持极低延迟与流式传输的同时,支持机器人、游戏、仿真等高频交互场景。
图为Reactor Technologies, Inc. CEO兼联合创始人Alberto Taiuti
在具身智能对谈环节,黎曼动力机器人创始人刘扬与破壳机器人创始人、清华大学交叉信息研究院助理教授许华哲围绕“具身世界模型的ChatGPT时刻”展开深度对话,探讨了世界模型与VLA的边界、机器人通用世界模型的训练瓶颈、具身智能的Scaling Law以及家庭机器人PMF等核心议题。
全模态内容革命圆桌对话举行,AI引领视频、游戏、音乐与文娱产业变革
近日,一场聚焦“全模态内容革命——AI重塑视频、游戏、音乐与全球文娱”的圆桌对话在论坛压轴环节举办。该对话由甲子光年创始人张一甲主持,昆仑万维董事长兼CEO方汉、中国电影家协会副主席黄晓明、演员王珞丹、爱奇艺高级副总裁杨海涛、青年导演崔睿共同参与讨论。
行业嘉宾共议AI与文娱融合新路径
圆桌对话围绕人工智能技术在视频、游戏、音乐及全球文娱领域的应用展开。与会嘉宾从不同视角探讨了AI如何推动内容生产模式的变革。
- 技术实践视角:方汉作为昆仑万维的负责人,分享了企业在AI技术与内容产业结合方面的探索。
- 行业协会与创作视角:黄晓明作为中国电影家协会副主席,王珞丹作为演员,崔睿作为青年导演,就AI对影视创作流程及艺术表达的影响发表了观点。
- 平台运营视角:杨海涛从爱奇艺平台角度,分析了AI在内容分发、用户交互及新类型内容孵化中的潜力。
“全模态”指代多类型信息(如文本、图像、音频、视频)的融合处理与生成,是当前AI技术向综合内容生产延伸的核心方向。
论坛现场展示跨界交流成果
论坛活动现场2的图示显示,嘉宾围坐探讨,现场气氛热烈。此次对话不仅汇聚了技术公司、行业组织、演艺界与平台方的代表,还形成了跨领域对话格局,为探讨AI在文娱产业的落地提供了多元视角。
从讨论内容看,与会者普遍认为AI技术正在重塑内容从创意、制作到分发的全链路,但其影响程度及具体应用形态仍在持续演进中。该对话作为论坛的压轴环节,为与会者提供了关于行业未来趋势的集中思考。

行业洞察:AI与文娱开启人机协同新范式
在近日举办的论坛活动中,一场围绕“AI与文娱产业的深度融合”的圆桌讨论引发行业关注。与会嘉宾从演员和导演的AI创作初体验出发,深入探讨了AI演员与真人创作者的价值博弈、AI重构平台内容生态,以及全模态AI重塑文娱赛道终局等多个维度。
嘉宾们一致认为,AI是文娱行业最好的工具与最大的革新者,而人类创作者永远是内容的灵魂缔造者,人机协同将成为全球文娱行业的新发展范式。
从创作初体验看人机协同
讨论中,多位演员与导演分享了将AI工具引入创作过程的初步实践。这种“AI创作初体验”表明,AI在辅助编剧、生成分镜、模拟角色表演等环节中,正逐步从概念走向落地。
有业内人士指出,AI能够为创作者提供高效的创作辅助,例如快速生成多个剧本架构或角色外观方案,从而激发人类的灵感延伸,而非替代人类的想象力。
AI演员与真人创作者的博弈与共生
圆桌讨论中,“AI演员与真人创作者的价值博弈”成为焦点。嘉宾们认为,AI演员在处理大规模群戏、动作替身或超现实角色时,展现出成本与效率优势。
然而,真人创作者在情感深度、即兴表演以及文化价值观传递方面具有不可替代性。嘉宾们强调,两者的博弈并非零和,而是可以形成互补:AI负责执行标准化、重复性工作,真人则专注核心创意与情感表达。
平台内容生态与全模态AI重构
围绕“AI重构平台内容生态”,讨论指出,AI能够通过算法推荐、内容自动生成与分发,极大提升平台的运营效率与用户匹配精准度。例如,AI可基于用户偏好动态生成短视频、游戏场景或交互剧情。
而“全模态AI重塑文娱赛道终局”则指向一个技术趋势:文本、图像、音频、视频等模态的打通,将使AI能够创作出融合多种感官体验的文娱产品。嘉宾们认为,全模态AI将推动文娱产品从单向输出向沉浸式交互演变。
新范式:人机协同的实践路径
与会嘉宾总结指出,人机协同正成为全球文娱行业的实践方向。在这一范式中,AI被视为革新工具,而非灵魂替代者。人类创作者需积极拥抱技术,将AI用于降低创作门槛、加速制作流程,同时守住内容的情感内核与价值观底座。
论坛现场嘉宾表示:“人机协同不仅关乎技术整合,更关乎如何在效率与艺术之间找到平衡点。”

王珞丹分享AI创作体验:为理想镜头熬夜“抽卡”至凌晨四点
演员王珞丹在近日的一次分享中,以自身实践讲述了使用AI工具进行创作的经历。她将这一过程形容为“痛并快乐着”,并坦言自己是从“小白”创作者起步,逐步摸索分镜、数字资产与人物设定。
反复调整提示词,清晨才获满意画面
王珞丹透露,为了获得一个理想的镜头,她曾熬夜至凌晨四点,不断调整AI提示词却始终得不到想要的结果。直到清晨,才终于“抽”到符合预期的画面。她表示,在这个过程中还请朋友帮忙,才最终得以完成创作。
“创作者首先是一个判断者和决策者,需要用审美去筛选和决定最终呈现的画面。”
AI提升运镜与流动性,但故事始终关键
她认为,AI能够带来超出想象的特殊运镜与画面流动性,这是传统手法难以实现的。但她同时强调,观众真正在意的是故事能否打动人心,而非背后的媒介形态。在她看来,无论技术如何发展,创作者始终是表达的核心。
- “抽卡”释义:在AI创作语境中,指用户反复输入提示词,由AI多次生成不同画面,如同游戏抽卡机制,从中选取最满意的一帧。
- “小白”起步:王珞丹表示,自己从零开始学习分镜、数字资产与人物设定,这些环节均需创作者逐一设定与修正。
判断与决策:创作者的核心角色
王珞丹进一步阐释,AI工具虽然能快速产出大量素材,但最终留下的画面必须依赖创作者的审美判断。她认为,技术的辅助放大了创作的可能性,但人的抉择仍是作品成型的关键环节。

昆仑万维提出“世界模型元年”概念,AI影视应用进入实操阶段
在近日举行的行业活动中,中国电影家协会副主席黄晓明、导演崔睿、爱奇艺副总裁杨海涛以及昆仑万维董事长方汉等嘉宾,围绕人工智能在影视创作中的应用现状与未来趋势展开讨论。嘉宾们一致认为,AI技术正在从“生成内容”向“理解物理世界”演进,而昆仑万维也于2026年正式宣告进入“世界模型元年”。
AI生成影像细节已达“以假乱真”水平,技术迭代令从业者惊讶
黄晓明在发言中分享了他对AI技术的亲身感受。他提到,三个月前观看一部由朋友制作的AI电影时,还能明显看出AI表演的痕迹。然而,最近再次观看该片时,“即便被告知那是AI生成,我已经完全分辨不出来了”。他形容AI生成的影像已经“细节到脸上的斑点毛孔,甚至微表情、毛孔都在演戏”。这种指数级的技术迭代让他深感震撼。
除了影视创作,AI也已融入黄晓明的日常体验。他透露,自己当天使用AI音乐工具Mureka生成了两首歌,效果不错。“我很喜欢杨宗纬的风格,就让Mureka照着《空白格》生了一首抒情的,歌词还挺触动人心的。”他明确表示,自己对AI保持高度开放态度,无论科技方向还是影视方向,都很想投资一些AI相关的项目。
AI解决“技术难题”,导演称SkyReels一致性突出
导演崔睿从创作实践角度指出,AI已在前期故事板制作和后期镜头补足等环节显著提升效率。他认为,AI在影视制作中最能发挥价值的场景,恰是那些人力成本最高、执行最繁琐的“技术难题”——例如需要成千上万群演的大场面。
提及昆仑万维的AI视频模型SkyReels,崔睿认为其一致性非常突出。他表示,该模型能有效解决创作者最头疼的“抽卡”效率问题,在系列化制作中保持人物、物体的稳定统一,避免反复尝试的无效劳动。同时,SkyReels的音画同步能力也值得肯定。他建议创作者尝试使用AI视频工具。
爱奇艺每日接收超3000部AI短剧,后台数据显示用户观看数据持续提升
爱奇艺副总裁杨海涛从平台数据出发,透露爱奇艺后台每日收到超过3000部AI短剧与上千部AI漫画,AI内容的观看数据持续提升。他以爱奇艺“燎原计划”扶持的网络电影《勿念》为例,介绍称AI在电影镜头特效制作方面实现了超过50%的提效,从导演构思到成片可节约三周以上的时间。杨海涛预计,今年暑期将上线更多AI参与的网络故事片。
技术方回应“塑料感”质疑:目标让模型更真实
昆仑万维董事长方汉作为技术方表态,承诺将持续降低创作门槛与Token成本,实现“人人如龙”的文化平权。他坦言,技术上的难点并非大场面、爆炸等传统拍摄中昂贵的镜头,而是小众场景数据量不足导致效果不佳。
“AI生成人像‘塑料感’的来源是扩散模型的去噪机制将所有面孔平均化。”方汉解释称,让模型更真实是所有从业者的共同目标。他预测,在“后AI时代”,演员需学习导演技能、导演需学习表演知识,角色边界将日益模糊。
共识:AI倒逼创作者回归内容本真,技术与情感表达并行
所有嘉宾共同指向一个共识:AI不会消解人的创造力,反而倒逼创作者更珍视自身的独特体验与情感表达,在技术赋能下回归内容的本真。
从战略层面看,昆仑万维自2022年确立“All in AGI与AIGC”战略,到2026年“世界模型元年”的正式宣告,完成了从全模态内容生成到可交互世界模型的关键跃迁。该公司表示,在世界模型和AIGC方向上,已取得全球领先的成果。
