中文

ARDuP:用于通用策略的主动区域视频扩散

计算机视觉与模式识别 2025-01-31 v2 机器人学

摘要

序列决策可被建模为文本条件视频生成问题,其中视频规划器受文本定义的目标指导,生成可视化计划动作的未来帧,随后从中派生控制动作。本文介绍了主动区域视频扩散用于通用策略(ARDuP),一种新的基于视频的策略学习框架,强调生成主动区域,即潜在交互区域,以增强条件策略对执行任务关键的交互区域的关注。该创新框架将主动区域条件与潜在扩散模型集成用于视频规划,并利用潜在表示进行逆动力学建模中的直接动作解码。通过利用视频中的运动线索进行自动主动区域发现,本方法消除了对主动区域手动标注的需求。我们通过在模拟器 CLIPort 和真实世界数据集 BridgeData v2 上的大规模实验验证了 ARDuP 的有效性,实现了显著的成功率提升并生成了令人信服的真实视频计划。

关键词

引用

@article{arxiv.2406.13301,
  title  = {ARDuP: Active Region Video Diffusion for Universal Policies},
  author = {Shuaiyi Huang and Mara Levy and Zhenyu Jiang and Anima Anandkumar and Yuke Zhu and Linxi Fan and De-An Huang and Abhinav Shrivastava},
  journal= {arXiv preprint arXiv:2406.13301},
  year   = {2025}
}

备注

Accepted by IROS 2024 (Oral)