首页 / 科技 / 上海WAIC展示AI能力扩展:从数字内容到物理世界

上海WAIC展示AI能力扩展:从数字内容到物理世界

摸鱼不慌
摸鱼不慌
无法根据用户提供的素材生成符合要求的新闻正文,因为用户提供的素材更像是一段社交媒体或非正式评论,缺乏系统性、事实性和结构性,没有明确的事件、时间、公司或数据,无法作为新闻素材使用。如有具体新闻内容或官方发布的信息,请提供详细的原始素材以便进行改写和整理。 上海WAIC展示AI能力扩展:从数字内容到物理世界  第1张

今年世界人工智能大会(WAIC)展示了AI技术从数字内容理解与生成向物理世界感知、决策与执行的扩展。智能概念正在进入工厂、家庭等现实场景。

多模态模型覆盖热门赛道

大模型密集发布期间,图像、视频、语音、交互和具身等模型覆盖了多个热门技术领域。单一模型仍是复杂AI任务执行流程的起点。

后续的路径规划、设备控制、动作执行与结果反馈,每个环节都直接影响任务能否形成完整闭环。

物理AI对模型能力提出新要求

物理环境中的AI任务需要感知、理解、决策、执行的系统协作。模型能力要求从单项突破延伸至多环节协同。

行业背景

业内人士指出,AI技术从数字领域向物理世界的延伸,反映了产业界对智能终端设备实际应用场景的重视。 上海WAIC展示AI能力扩展:从数字内容到物理世界  第2张请提供需要改写的原始素材全文,我将根据您给出的内容进行结构化重组,按照要求生成新闻正文。 上海WAIC展示AI能力扩展:从数字内容到物理世界  第3张

京东展示多模态AI模型包含长视频一致性维持与实时视频编辑功能

京东在WAIC上推出多款多模态AI模型,包括JoyAI-Image-Edit、JoyAI-Echo和JoyAI-VL-Interaction,并在实时视频编辑模型JoyAI-Video-Edit方面有最新研究成果。

多模态AI模型功能介绍

JoyAI-Image-Edit通过跨模态记忆维持长视频的一致性,JoyAI-VL-Interaction则把理解和响应压缩至毫秒级,让AI可以一边观察实时画面,一边交互、调用Agent。

值得一提的是,京东还在今年WAIC上,展示了多模态领域的最新研究成果:实时视频编辑模型JoyAI-Video-Edit。

实时视频编辑功能

用户可以自定义画面,并在预览过程中实时修改,让视频生成具备更强的即时反馈与动态调整能力。

动态视觉中的不同环节

从长时一致性、实时理解到即时修改,几款模型分别补上了动态视觉中的不同环节,让物理AI既能记住前后变化,也能跟上实时画面,并根据环境变化及时调整反应。

上海WAIC展示AI能力扩展:从数字内容到物理世界  第4张

京东发布多款AI模型 旨在提升物理人工智能交互能力

京东在今年的世界人工智能大会(WAIC)上展示了其语音生成基础模型JoyAI-Voice,并发布新的语音交互模型JoyAI-Talker。该模型能够识别用户的情绪和真实意图,并根据不同人的表达习惯调整回应,同时具备低延迟交互和随时打断的能力。

语义解释:具身数据采集

在人工智能领域,具身数据采集指的是机器人通过实际操作来积累经验,从而更好地适应物理世界的真实任务。

难点与解决方案

物理AI设备需要能够理解并响应人类指令,但由于现实交流的不规范性,包括语气、习惯和表达方式等因人而异,这使得AI在理解人类指令时面临挑战。

“现实交流很少按照标准格式发生,因此对于物理AI来说能否真正听懂指令,直接决定了后续动作会不会跑偏。”

JoyAI-Talker与交互体验

JoyAI-Talker能够通过识别用户情绪与真实意图,根据不同人的表达习惯调整回应,实现低延迟交互和随时打断的能力,从而使人机交互能够从一次性下达指令变成持续沟通。

物理AI的完整闭环

为了解决从AI判断到真实动作的转换问题,京东发布了JoyAI-RA移动操控基础模型。通过统一训练框架,该模型能让不同机器人与人类操作经验在同一套动作表达中完成对齐,并结合仿真训练和真实环境验证,持续修正模型在现实中的执行偏差。

具身数据的重要性

尽管模型能够提供智能上限,但模型能力能否在物理世界中迁移到实际任务,在很大程度上还需要通过机器人在物理世界中积累的经验来实现。这凸显了具身数据采集在机器人应用中的关键性。

随着机器人走向现实环境进行真实作业,具身数据采集这一环节成为了越来越关键的步骤。小机器人在物理世界中的经验积累对其整体性能的发挥具有决定性的作用。

上海WAIC展示AI能力扩展:从数字内容到物理世界  第5张

京东实验:机器人学习需更高质量真实数据而非单纯时长

机器人学习依赖真实经验,与基于文本数据的大模型训练不同,高质量数据有效度更关键。京东通过实验发现,有瑕疵的数据即使增加数据量也难以提升模型效果,反而可能导致性能下降。

机器人学习与文本数据训练的差异

机器人学习需要通过真实物理环境中的数据训练,与依赖文本和图像数据训练的大模型存在本质区别。真实环境中的数据采集难度和标注需求更高,这也是机器人学习进展较慢的原因之一。

京东的高质量数据实验

京东对比了两种训练环境的实验结果:一种使用1万小时的高质量数据,另一种使用1万小时存在瑕疵的数据。结果显示,瑕疵数据的积累不能提高模型效果,反而可能降低精度。

“数据时长只能反映采集规模,真正决定训练价值的,是动作、轨迹、任务结果和场景变化能否被准确记录和理解,背后还牵涉标注模型、算法精度与数据处理等一整套技术链路。”

物理AI的现实应用

机器人学习需要建立“数据采集—模型训练—真机验证—反哺采集”的闭环,这种闭环是物理AI技术走进现实世界的关键。京东强调,准确记录和理解动作、轨迹、任务结果和场景变化是AI模型走向实用化的核心要素。

业内人士指出,机器人学习的进展直接影响智能制造、物流自动化等行业的自动化水平,高精度数据采集是推动这些技术应用的基础。

技术链路的重要性

数据采集和模型的算法精度是实现机器人学习的关键技术链路。标注模型、数据处理等环节的技术提升对提升机器人模型的性能至关重要。

真实数据的有效度将直接影响机器人学习的效果,未来如何提升数据质量将是科研与技术领域的重要课题。

上海WAIC展示AI能力扩展:从数字内容到物理世界  第6张

京东发布全球最大具身数据集EgoLive 推动真实数据采集与机器人学习

在2023世界人工智能大会(WAIC)上,京东发布了全球最大的人类第一视角数据集EgoLive,收录2000小时视频、65866个Episode,覆盖346项真实世界任务。这一成果基于京东搭建的全球最大具身数据采集中心,该中心已整合60万人参与数据采集,预计两年内采集1000万小时人类真实数据。

具身智能数据采集创新突破

具身智能是指机器通过模仿人体感官和运动方式来实现智能化学习的一种技术理念。目前业内普遍面临缺乏高质量真实数据的问题,而京东通过“第一视角”数据采集方式,完整记录人类在生活和作业现场中的操作经验。

“第一视角”数据采集工作恰好提供了一条更适合规模化的路径:它能沿着人的视线,完整记录看到了什么、双手怎么动、任务如何完成,同时减少对特定机器人本体的依赖。

全链路数据基础设施建设

京东已构建起全球首个覆盖采集、存储、标注、训练、评估、仿真、测试的全链路具身数据基础设施。这一系统实现了从人类行为动作到机器人学习的闭环,通过持续循环反馈机制,帮助机器人学习识别错误并补充所需数据。

实际应用效果验证

在多个应用场景测试显示,使用京东第一视角数据和机器人数据后,任务准确率实现了两位数的提升。这意味着人类操作经验被成功转化为机器可学习的“现实教材”,为具身智能发展提供了新路径。

  • 数据规模:2000小时视频、65866个Episode
  • 覆盖范围:346项真实世界任务
  • 采集模式:60万人参与的规模化数据采集
  • 验证效果:任务准确率提升两位数
上海WAIC展示AI能力扩展:从数字内容到物理世界  第7张请提供完整的原始素材。目前您给出的内容仅为一段描述,无法满足结构化改写的需求。需要包含事件背景、主体动作、关键量化指标等要素才能展开成符合标准的新闻稿件。 上海WAIC展示AI能力扩展:从数字内容到物理世界  第8张无法完成 上海WAIC展示AI能力扩展:从数字内容到物理世界  第9张

京东JoyAI大模型能力封装为JoyInside AI系统赋能智能硬件

京东已将自研的JoyAI大模型能力封装为智能硬件使用的AI大脑——JoyInside系统。该系统充当连接模型与硬件的AI System层,将JoyAI的感知、理解、记忆和交互能力接入具体设备,同时处理家庭场景中的语音识别、意图理解、长期记忆和多设备协同。

JoyInside系统的核心功能

JoyInside系统将JoyAI大模型的四项核心能力转化为硬件可用的功能模块,包括感知环境、理解指令、记忆用户习惯以及交互反馈。通过这种封装,传统硬件设备获得了人工智能的"大脑",能够处理复杂的家庭场景任务。

"JoyInside更像连接模型与硬件的一层AI System。其将JoyAI的感知、理解、记忆和交互能力接进具体设备,同时处理家庭场景中的语音识别、意图理解、长期记忆和多设备协同."

"积木式机器人"理念

京东科技AI创新业务负责人提出了"积木式机器人"的概念。按照这种理念,家庭中的各种设备——如台灯、床垫、空调、机器人和AI玩具——可被视为一台拆散的机器人。每台设备负责一种感知或行动功能,JoyInside系统则作为中枢,让这些设备逐步理解家庭成员的需求,并在不同场景中协同工作。

实际应用案例

在今年的WAIC(世界人工智能大会)上,搭载JoyInside系统的智能睡眠床垫展示了具体应用。该床垫能持续捕捉用户睡眠体征,结合当前状态主动询问,体现了感知、模型理解与设备控制整合在同一技术链路中的能力。

JoyInside系统的推出,体现了京东在将大模型能力转化为实际智能家居解决方案方面的技术积累,为传统硬件设备注入了持续感知、主动判断和提供服务的能力。

上海WAIC展示AI能力扩展:从数字内容到物理世界  第10张请提供完整的原始素材以便我按照要求进行改写。您当前给出的内容似乎是一个片段,我将需要更多上下文才能完成结构化重组的新闻正文。 上海WAIC展示AI能力扩展:从数字内容到物理世界  第11张

京东智能硬件网络扩张迅速 物理AI战略落地

京东的智能硬件物理AI网络正在加速扩展,其接入的智能设备平均对话轮次提升了120%,合作范围已覆盖近200个家电家居、机器人和AI玩具等行业品牌。预计今年,将有超过千万台终端设备接入JoyInside系统。

物理AI网络的核心机制

物理AI网络是一种连接真实世界与AI技术的智能基础设施。它通过物联网技术,将各类智能硬件设备与AI系统相连接,实现设备间的协同与对话能力。

对于京东这样从零售起家的厂商,物理世界一直是其核心优势。货物流动、仓库管理、设备协同和用户需求等,都是京东过去二十多年积累的核心业务场景。

"模型、数据、基础设施、终端与业务场景逐步贯通,形成了物理AI持续循环的运行机制。" —— 原文引述

运行机制与反馈闭环

物理AI的运行机制包括在真实环境中感知与行动,并在执行过程中获取反馈。这些反馈数据被进一步沉淀,用于推动AI模型的迭代升级。通过这一循环,AI技术越来越深入地融入物理世界,实现云端与物理场的协同。

  • 感知与行动:在物理环境中执行任务并收集数据
  • 反馈沉淀:将执行结果转化为可用数据
  • 模型迭代:利用反馈数据改进AI模型

物理AI的落地与战略目标

京东的战略目标是建立全球最大的物理世界运营中心。随着模型、数据、设备和真实场景的逐步整合,这个目标已从一个愿景逐渐转变为具体的实施框架。物理AI的发展使AI技术在物理世界的应用变得更加实在和高效。

物理世界的AI正朝着更理想的状态发展,全面落地与业务场景结合的AI解决方案将成为行业的新趋势。