通过计划与代码反思实现长时程视觉模仿学习
机器人学
2025-12-19 v3 人工智能
机器学习
摘要
从长时程演示中学习包含复杂动作序列的视觉模仿学习面临着诸多挑战,尤其在理解动作的时间关系以及物体之间的空间关系方面。本文提出了一种新型智能体框架,融合两个专用反思模块以增强计划与代码生成。计划生成模块产生初始动作序列,随后由计划反思模块验证以确保其在演示视频中的时间连贯性和空间对齐。代码生成模块将计划转化为可执行代码,而代码反思模块则验证并细化生成的代码以确保其正确性与生成计划的一致性。这两个反思模块共同使智能体能够检测并纠正计划生成和代码生成中的错误,提高了在任务具有复杂时空依赖性方面的性能。为支持系统评估,我们引入了 LongVILBench,一个包含 300 组人类演示的数据集,动作序列最长可达 18 步。LongVILBench 强调跨多种任务类型的时空复杂度。实验结果表明,现有方法在该数据集上表现不佳,而我们新框架为长时程视觉模仿学习建立了强大的基线。
引用
@article{arxiv.2509.05368,
title = {Long-Horizon Visual Imitation Learning via Plan and Code Reflection},
author = {Quan Chen and Chenrui Shi and Qi Chen and Yuwei Wu and Zhi Gao and Xintong Zhang and Rui Gao and Kun Wu and Yunde Jia},
journal= {arXiv preprint arXiv:2509.05368},
year = {2025}
}
备注
9 pages, 4 figures