RAP:用于教学视频中自适应步骤规划的检索增强规划器
计算机视觉与模式识别
2024-09-26 v2 人工智能
机器人学
摘要
教学视频中的步骤规划需要基于对初始状态和目标状态的视觉观察,生成一系列动作步骤。尽管该任务进展迅速,但仍存在几个关键挑战有待解决:(1)自适应步骤:先前的工作持有不切实际的假设,即动作步骤的数量是已知且固定的,导致模型在序列长度变化的现实场景中泛化能力不足。(2)时序关系:理解步骤间的时序关系知识对于生成合理且可执行的计划至关重要。(3)标注成本:用步骤级标签(即时间戳)或序列级标签(即动作类别)标注教学视频既费力又劳动密集,限制了其在大规模数据集上的泛化能力。在这项工作中,我们提出了一种新的实用设定,称为教学视频中的自适应步骤规划,其中步骤长度不固定或预先确定。为应对这些挑战,我们引入了检索增强规划器(RAP)模型。具体而言,对于自适应步骤,RAP 使用自回归模型架构自适应地决定动作的结束。对于时序关系,RAP 建立了一个外部记忆模块,以显式地从训练视频中检索最相关的状态-动作对,并修正生成的步骤。为解决高标注成本问题,RAP 采用弱监督学习方式,通过为动作步骤生成伪标签,将训练数据集扩展到其他任务相关但未标注的视频。在 CrossTask 和 COIN 基准上的实验表明,RAP 优于传统的固定长度模型,确立了其作为自适应步骤规划强基线解决方案的地位。
引用
@article{arxiv.2403.18600,
title = {RAP: Retrieval-Augmented Planner for Adaptive Procedure Planning in Instructional Videos},
author = {Ali Zare and Yulei Niu and Hammad Ayyubi and Shih-fu Chang},
journal= {arXiv preprint arXiv:2403.18600},
year = {2024}
}
备注
Accepted in ECCV 2024