面壁智能开源具身智能系列模型 采用全新上下文记忆技术
请提供需要处理的原始新闻素材,我将按照您指定的要求进行结构化重组和格式化排版。

具身智能领域迎来新进展。7月19日,面壁智能在WAIC现场宣布开源首个具身智能系列模型成果,包含2个模型:MiniCPM-RobotManip、MiniCPM-RobotTrack。其中MiniCPM-RobotManip创造了RMBench榜单最高分。
具身智能的记忆难题
具身智能是指让机器人具备环境感知、决策判断和执行操作的能力。目前主流的基于单帧反应式的视觉语言行动模型(VLA)难以解决上下文记忆问题,面对简单重复任务也束手无策。
VLA是一种融合视觉、语言、行动多模态信息的深度学习模型,可以理解图片和视频,并做出反应。但业界不少机器人不记得自己的操作历史,很难完成需要记忆次数的任务。
“很多机器人根本不记得自己按了几次。”
真正的困难在于,很多机器人天生不具备记录自身行动序列的能力,这与人类习惯将上一次任务结果作为下一次任务的输入完全不同。
开源自研具身智能模型
针对以上问题,面壁智能自主研发了上下文记忆模型,7月19日将其集成到新发布的模型系列MiniCPM-Robot中开源。这一系列包含2个模型:
- MiniCPM-RobotManip:通用VLA模型,具有上下文记忆能力
- MiniCPM-RobotTrack:跟踪导航模型
据测试,MiniCPM-RobotManip在机器人模型上下文记忆能力RMBench榜单上达到53.5分,领先美国知名VLA模型pi0.5的10.4分。
“原生上下文的能力,当前主流基于单帧反应式的VLA是做不到的。”
业内人士指出,上下文记忆能力是具身智能的关键突破点,这一能力补齐了机器人行业的致命短板,直接提升了机器人处理复杂任务时的效率。
技术亮点
MiniCPM-Robot系列模型的创新之处在于,内部的“机械臂”可以记住自己的操作序列。无需依赖外部记忆单元,就能完整复现并保存上一个任务的操作历史。这种原生上下文能力,大大提升了机器人在复杂环境下的导航和操作能力。


面壁智能通过视觉压缩技术提升VLA模型在机器人场景中的效率
面壁智能学术合伙人、多模态智能首席科学家姚远团队,通过研发的视觉压缩技术,成功将VLA模型从算力压力中解放出来,显著降低了机器人在真实物理世界中的操作成本。该技术使机器人在执行任务时能够以更高的效率运行。
视觉压缩技术的核心原理
在机器人操作场景中,VLA模型需要处理三路相机画面(双腕部相机和主视角相机)以及文本指令,并输出相应的动作。若处理过程过慢,机器人将出现明显的卡顿现象,而在物理世界中,这种延迟可能导致严重后果。
姚远团队指出,视觉Token压缩的本质是进行精准的“减法”。未经处理的多路图像会产生大量Token,直接降低推理速度。通过高效压缩,可以用更少的Token传递相同的视觉信息,类似将高清图片转换为高质量的JPEG格式,既保持画质,又大幅减小文件体积。
技术效果与数据对比
实测数据显示,在机器人场景下,经过视觉压缩优化的MiniCPM-RobotManip模型单步决策仅需120毫秒,而未优化的pi0.5模型则需要234毫秒。后者的处理时长是前者的近两倍,说明压缩技术显著提升了推理效率。
该技术的应用直接降低了机器人对计算资源的依赖,使得复杂任务能够在更低的成本下实现。对于工业自动化和日常服务机器人来说,这一突破有助于减少设备投入和运营费用。
- VLA模型处理的输入包括双腕部相机、主视角相机画面和文本指令。
- 视觉Token压缩技术能够减少Token数量,同时保持信息完整性。
- MiniCPM-RobotManip模型的决策时间比未优化的模型缩短了60%以上。




PhyAI适配MiniCPM-Robot 首日完成CUDA Graph加速 框架开源拉低具身智能研发门槛
PhyAI在发布首日即完成对MiniCPM-Robot的适配支持,并使用CUDA Graph进行加速,将推理帧率从10.20 Hz提升至33.2Hz。此举旨在向行业输出技术能力。
技术升级提升推理效率
团队采用了算子融合的方法,使其在NVIDIA H20上的推理帧率进一步提升至36.77Hz,为具身智能应用提供更高性能支持。
技术栈完整开源 降低行业门槛
此次开源的内容包括模型权重、推理框架及部署方案,开发者可直接使用,无需重新搭建复杂的感知、规划和控制系统。
CUDA Graph是一种用于加速深度学习推理的图形化工具,通过优化计算图的执行,可以有效提升推理效率。
“这意味着具身智能的研发门槛被大幅拉低了。”
具身智能是一种结合了感知与动作的智能体技术,在机器人等场景中具有广泛应用前景,此次开源将推动更多开发者进入该领域。
面壁智能布局具身智能 助力AI技术向物理世界拓展
面壁智能选择了一条与其他大模型公司不同的路线:端侧通用人工智能的探索,尤其是在具身智能领域的布局。AI竞赛进入下半场,赋予AI身体、使其进入物理世界成为重要主题。面壁智能、智谱等公司纷纷加入具身智能布局,这反映了行业发展的趋势。
具身智能:物理世界与AI的融合
具身智能是指让AI拥有身体,能够在物理世界中执行任务。目前,大模型公司在语言层面的通用智能方面取得了进展,但物理层面的通用智能才刚刚开始。面壁智能认为,只有语言层面和物理层面的通用智能同时实现,才能达到真正的通用人工智能(AGI)。
具身智能需要融合视觉、语言等多模态信息,而这正是面壁智能的优势所在。公司自研的多模态模型MiniCPM-V/O系列已迭代两年半,开源下载量突破2500万。其中,MiniCPM-V 4.6开源不到2个月下载量突破200万,在国内外社区影响力广泛。
具身智能团队热招VLA、世界模型、硬件相关研究及工程岗位,可通过以下二维码投递。
端侧AI的独特价值
面壁智能选择的端侧路线包括手机、汽车、机器人等终端设备。在WAIC上,面壁智能展示了与乐聚机器人、吉利汽车等伙伴的产业落地案例,如展厅导览、园区巡检、仓储物流等。在这些场景中,端侧能力不是“加分项”,而是“入场券”。
许多展馆、园区、厂区存在信号盲区,为了让机器人在任何网络环境下都能稳定工作,需要强大的端侧模型作为支持。端侧AI的独特价值体现在隐私安全、低延迟和无网可用等方面。
通用智能与多模态技术的优势
面壁智能追求通用智能而非专用技能,拥有深厚的多模态技术积累。MiniCPM-RobotManip是面壁智能这一理念的产物,先打造通用大脑,再适配多元场景。这与多数具身团队从特定场景出发、由点及面地打磨专用技能的路径不同。
面壁智能的多模态家底使其能够快速切入机器人赛道。通过视觉Token的极致压缩,解决了机器人“金鱼脑”的记忆短板。公司用自己的节奏,走出了一条独特的端侧AGI之路。
中国机器人的AGI时代
面壁智能认为,机器人真正“好用”的关键往往藏在看不见的地方,比如记住按了几次按钮。对于能够优雅做出三明治的机械臂,面壁智能有理由相信,属于中国机器人的AGI时代已经开启。
