首页 / 科技 / 汤元科技提出4D真值监督方案 从路侧视角构造自动驾驶训练数据

汤元科技提出4D真值监督方案 从路侧视角构造自动驾驶训练数据

摸鱼不慌
摸鱼不慌
汤元科技提出4D真值监督方案 从路侧视角构造自动驾驶训练数据  第1张

自动驾驶与机器人所需的世界模型,正从单纯的视频预测向更复杂的动态场景理解演进。仅仅预测下一帧画面已无法满足决策需求,行业开始探索一种包含空间、语义和时序信息的“4D真值”训练方式。

世界模型训练向4D状态理解进阶

如果只将世界模型理解为视频生成,训练目标是让画面自然、运动连贯。但实际应用中,自动驾驶系统不仅需要预测摄像头画面,还需理解画面背后的空间结构:车辆与行人的精确位置、道路边界、遮挡关系,以及执行某一动作后环境状态的变化。这要求模型从2D像素预测,转向包含时间维度的4D世界状态理解。

4D真值监督的定义与结构

在机器学习中,“真值”通常指用于对照的标准答案。传统视频训练的标准是下一帧图像;4D真值监督的标准则升级为一套动态的世界状态。它至少包含三层信息:空间层面的三维几何(车辆车道、距离、朝向),语义层面的对象类别(车、人、信号灯、可行驶区域),以及动态层面的时序变化(加速、减速、等待、横穿)。如果进入决策控制环节,世界模型还需理解操作带来的环境状态变化。

所谓“4D真值”,即在3D空间维度基础上加入时间维度,形成动态的世界状态描述。它要求模型在理解物体几何位置的同时,掌握其在时间轴上的演变规律。

行业现有做法与各自局限

目前行业存在两类典型做法。一类是利用3D occupancy(空间网格化)或BEV(鸟瞰视角)表达世界状态,预测未来几秒的状态快照。这种结构化表示便于学习空间关系,但压缩过程会丢失纹理、光照等细节,难以承担高保真数据生成和通用物理仿真的任务。

另一类是先通过NeRF、3D高斯泼溅等技术重建可渲染的三维场景,实现多视角一致。这类技术将道路、建筑等静态背景与车辆、行人等动态对象分开建模,但本质上侧重视觉重建,对于复杂的交互信息仍需进一步建模。

4D真值在训练中的关键约束

引入4D真值关键是为模型施加四重约束:

  • 几何约束:确保物体在不同视角下的位置、尺度和朝向一致。
  • 时间约束:保证车辆轨迹连续、速度变化合理,避免时序跳跃。
  • 多视角约束:令不同传感器映射到同一真实场景,避免信息割裂。
  • 语义与动作后果约束:使模型理解交通信号含义及驾驶操作对环境的影响。
这些约束合在一起,才让世界模型从“渲染器”(renderer)走向“模拟器”(simulator)。

数据瓶颈:车端视角的天然局限

4D真值的建立离不开高质量数据。传统方式依靠车端采集摄像头、雷达和激光雷达数据,再经过标定融合得到真值。但车端数据天然带有单车视角局限——它只能记录“眼前的世界”,被大车挡住的行人、侧后方快速接近的车辆、路口另一侧正在形成的冲突信息往往不完整。要训练更可靠的世界模型,真值本身也需要更全面的视角。

汤元科技提供的解法:路侧世界转回车端视角

针对车端数据的局限,行业参与者汤元科技提供了一种解法:把路侧世界转回车端视角。其核心思路是利用路侧设备覆盖广、遮挡少的优势,获取路口完整的交通参与者与环境状态信息,再将其映射为模型训练所需的单车视角数据。

从依赖车端到融合路侧信息,意味着世界模型能够突破单车的感知边界,获取更完整的4D时空信息,为复杂场景下的决策和规划提供更可靠的训练基础。

汤元科技提出4D真值监督方案 从路侧视角构造自动驾驶训练数据  第2张

汤元科技公开论文提出路侧转车端视角 用于自动驾驶训练数据生成

成立仅一年的自动驾驶数据公司汤元科技,近日公开一篇题为I2V-GS的论文,探讨如何将路侧基础设施采集的视角转换为车端视角,以生成自动驾驶系统的训练数据。该方法并不依赖简单的图像变形,而是通过三维场景重建、激光雷达校准深度及多视角一致性约束,形成一条完整的数据生产链路。

依托苏州相城路侧设施 获取全局交通状态

汤元科技于2024年成立,总部设在苏州相城区,该区域近年来持续部署智能网联汽车与车路云一体化相关设施。大量路口和路段已安装摄像头、激光雷达、毫米波雷达及边缘计算设备。这些设备原本服务于车路协同与智慧交通,但也能提供不同于车载传感器的数据视角——不是某一辆车眼前的局部画面,而是一个路口或一段道路内更完整的交通状态。

公司的CEO任冬淳长期从事机器人、自动驾驶与世界建模研究,后在美团自动驾驶负责算法研发与工程落地。从研究到产业一线的经历,使汤元科技在构建世界模型时更关注数据生产、真值构建和训练闭环等实际问题。

I2V-GS方法:从三维重建到跨视角补全

论文全称为Infrastructure-to-Vehicle View Transformation with Gaussian Splatting for Autonomous Driving Data Generation,核心任务是将路侧视角转换为车端视角。路侧设备站得高、看得远,能捕捉路口的整体交通关系;车端传感器位置低、视角窄,后者才是自动驾驶系统实际面对的输入。二者之间的转换不仅仅是相机位置的变化,还包括大小、位置和遮挡关系的改变,需要先还原空间关系。

第一步是利用3D Gaussian Splatting(3DGS)建立场景。3DGS通过大量分布在三维空间中的高斯体(Gaussian)表示场景,每个高斯体携带位置、尺度、颜色和透明度等信息,组合后可从新的相机位置重新渲染。关键不在于生成一张新的图片,而在于把车辆、行人、道路、信号灯等元素放回统一的三维空间,为视角转换建立正确的几何基础。

“关键不在于生成出一张新的图片,而在于先把场景本身建立起来。只有把车、人、道路、信号灯这些元素放回统一的三维空间里,后面的视角转换才有意义。”

深度校准与自适应视角补充

路侧摄像头固定、视角有限,从稀疏视角重建稳定的三维场景并不容易。为此,I2V-GS引入单目深度估计,但单目估计的数字未必准确。论文的处理方法是使用LiDAR来校准单目深度。LiDAR作为空间参照系,锁定场景中的真实距离,使后续视角转换拥有可靠的几何基础。

在深度校准之后,方法进入adaptive depth warp步骤。从路侧高位切换到车端低位,近处物体变化大、远处变化小,遮挡关系也会改变。直接投影常产生空洞和拉伸。adaptive depth warp利用深度信息把原始图像生成一批新的伪视角,相当于为3DGS增加更多训练角度,补出更接近车端位置的中间视角。

扩散模型补全缺失区域 跨视角约束保证一致性

即便经过warp,画面中仍有缺口。I2V-GS引入扩散模型补全新视角中缺失的区域,例如车身背面、天空或被遮挡部分。但扩散模型单独生成可能使不同视角间对不上。因此论文通过cascade strategy和cross-view information约束生成过程,用多个视角的信息互相校验补全结果。扩散模型负责填补空隙,但最终还要接受几何关系和多视角一致性的检查。

一条完整的数据链路而非单一的生成模型

I2V-GS的整体流程并非简单将路侧视频转换成车端视频,而是一条完整的数据链路:先重建三维场景,用LiDAR校准深度和尺度,通过adaptive depth warp补充中间视角,利用扩散模型填补缺失区域,最后用跨视角约束保证场景一致性。在这条链路中,生成模型固然重要,但前面的几何重建、深度校准以及后面的多视角一致性检查才是保证视角转换正确的前提。

该论文为构建世界模型提供了一种新的技术思路,使真实道路有望转化为可持续生产、可交付的自动驾驶训练数据产品。

汤元科技提出4D真值监督方案 从路侧视角构造自动驾驶训练数据  第3张

汤元科技推出Yootta数据平台,基于真实道路重建生成自动驾驶训练数据

面向自动驾驶研发对高质量训练数据的真实需求,汤元科技发布Yootta(优塔)数据平台。该平台不依赖虚拟场景建模,而是从真实道路出发,通过“Real2Sim2Real”链路生成高保真合成视频、3D真值与仿真场景,为感知模型训练和算法验证提供可复用的数据资产。

Real2Sim2Real:从真实道路到数字空间再回到模型训练

Yootta平台的核心路径是先采集路口、道路、车辆、行人及路侧传感器数据,将其重建进数字空间;再从数字空间生成车侧视角的训练数据。与行业传统的Sim2Real方法不同,汤元科技的技术路线融合了Real2Sim(真实世界数字化)与Sim2Real(数字世界反哺真实模型),使得数据的起点始终是真实道路的交通结构、对象关系与动态变化。

“数据的起点是真实道路。真实交通里的空间结构、对象关系、遮挡和动态变化先被保留下来,再去做视角转换、天气光照变化和长尾场景扩展。”

NVIDIA Cosmos补全重建盲区,扩展场景多样性

真实世界重建并非万能。路侧传感器存在视野盲区,如天空、远处背景、被遮挡区域及极端天气下的光照变化,难以完全通过三维重建补全。汤元科技引入NVIDIA Cosmos,用于缺失信息补全、多样化视角生成和复杂环境泛化,将一个真实路口扩展为更多训练样本。Cosmos与4D重建配合,在结构约束的4D世界内进行补全和扩展,而非替代重建。

数据产品与闭环仿真支撑自动驾驶研发

Yootta平台交付的是可直接进入研发流程的数据产品,主要包括三类:

  • 高保真合成视频集:补充视觉训练样本;
  • 3D真值:用于感知和场景理解;
  • 多场景标注:接入客户已有数据管理与训练流程。

在此基础上,汤元科技将能力延伸至闭环仿真。合成数据解决“模型还未见过什么”,闭环仿真解决“模型遇到之后会怎么做”。同一危险路口可改变车流密度、天气、行人轨迹与本车策略;同一corner case(指长尾边缘场景)可在不同算法版本中反复测试验证。

落地案例:已与梅赛德斯-奔驰、清华大学共建闭环仿真平台

汤元科技曾与梅赛德斯-奔驰、清华大学联合开发基于4D结构数据的闭环仿真平台,用于自动驾驶开发、测试与验证。此外,公司已向头部主机厂和Tier1客户交付高保真合成视频集、3D真值与多场景标注等数据产品,支持量产流水线使用。

真实道路上的corner case——如大车遮挡后的行人穿出、非机动车突然变道、施工路口临时绕行、雨夜反光与误判——在自动驾驶训练中均是宝贵材料。汤元科技通过路侧数据、4D重建与生成补全,将这些一次性道路事件转变为可反复训练、复现和验证的场景资产。这一方法可能改变自动驾驶获取长尾数据的方式,让世界模型不仅生成视频,更将真实道路的复杂性重新交还给训练系统。