从偶然演示视频中记忆技能:面向交互式动作规划的拓扑 affordance 记忆与变换器架构
机器学习
2025-07-08 v1 人工智能
计算机视觉与模式识别
摘要
通过演示学习执行活动任务需要从观察中提取有关环境的有意义信息。本研究旨在从偶然视角出发,在仿真环境中从演示中规划以高层目标为导向的动作。我们提出了一种新任务——交互式动作规划,并提出了一种结合拓扑 affordance 记忆与变换器架构的方法。通过提取 affordance 来构建环境结构的记忆过程,有助于根据上下文选择合适的动作。此外,记忆模型允许我们在完成特定目标时检测动作偏差。为评估该方法的通用性,我们在逼真的交互式仿真环境中对其进行评估。我们的实验结果表明,所提出的方法学习到了有意义的表示,能够实现更好的性能和在动作偏差发生时保持稳健性。
引用
@article{arxiv.2507.02997,
title = {What to Do Next? Memorizing skills from Egocentric Instructional Video},
author = {Jing Bi and Chenliang Xu},
journal= {arXiv preprint arXiv:2507.02997},
year = {2025}
}