中文

DRAW2ACT:将深度编码轨迹转化为机器人演示视频

计算机视觉与模式识别 2025-12-17 v1 机器人学

摘要

视频扩散模型为具身AI提供了强大的真实世界模拟器,但在机器人操作的可控性方面仍存在局限。最近关于轨迹条件视频生成的工作填补了这一空白,但通常依赖于二维轨迹或单模态条件,这限制了它们生成可控且一致的机器人演示的能力。我们提出了DRAW2ACT,一个深度感知的轨迹条件视频生成框架,从输入轨迹中提取多种正交表示,捕捉深度、语义、形状和运动,并将它们注入扩散模型。此外,我们提出联合生成空间对齐的RGB和深度视频,利用跨模态注意力机制和深度监督来增强时空一致性。最后,我们引入了一个以生成的RGB和深度序列为条件的多模态策略模型,用于回归机器人的关节角度。在Bridge V2、Berkeley Autolab和仿真基准上的实验表明,DRAW2ACT在视觉保真度和一致性方面取得了优越表现,同时相比现有基线实现了更高的操作成功率。

关键词

引用

@article{arxiv.2512.14217,
  title  = {DRAW2ACT: Turning Depth-Encoded Trajectories into Robotic Demonstration Videos},
  author = {Yang Bai and Liudi Yang and George Eskandar and Fengyi Shen and Mohammad Altillawi and Ziyuan Liu and Gitta Kutyniok},
  journal= {arXiv preprint arXiv:2512.14217},
  year   = {2025}
}