中文

从单个时序错位视频中进行模仿学习

机器学习 2025-07-16 v2

摘要

我们考察了从单个视觉演示中学习顺序任务的问题。当演示因时间偏移、本体差异或执行不一致而产生时序错位时,便存在关键挑战。现有方法将模仿视为分布匹配问题,在代理与演示之间对齐单个帧,但我们发现,这类帧级匹配无法强制执行时间顺序或确保一致的进度。我们的关键洞察是,匹配应在序列层面上定义。我们提出,完美匹配发生在一个序列成功地以与另一个序列相同顺序覆盖所有子目标时。我们提出了ORCA(ORdered Coverage Alignment),一种稠密时序奖励函数,衡量代理以正确顺序覆盖演示帧的概率。在时序错位的演示上,我们表明使用ORCA奖励训练的代理在Meta-world任务上实现了4.54.5x改进(平均归一化回报从0.11提升至0.50),在Humanoid-v4任务上实现了6.66.6x改进(平均回报从6.55提升至43.3)。我们还提供了ORCA对不同时序错位程度的鲁棒性实证分析。我们的代码已公开于https://github.com/portal-cornell/orca/

关键词

引用

@article{arxiv.2502.05397,
  title  = {Imitation Learning from a Single Temporally Misaligned Video},
  author = {William Huey and Huaxiaoyue Wang and Anne Wu and Yoav Artzi and Sanjiban Choudhury},
  journal= {arXiv preprint arXiv:2502.05397},
  year   = {2025}
}

备注

ICML 2025