中文

通过计划与代码反思实现长时程视觉模仿学习

密码学与安全 2026-04-16 v4 人工智能

摘要

学习包含复杂动作序列的长时程演示,对视觉模仿学习提出了重大挑战,尤其是理解动作的时间关系以及物体之间的空间关系。本文提出一种新的agent框架,包含两个专门的反思模块,以增强计划和代码生成。计划生成模块产生初始动作序列,然后由计划反思模块验证以确保与演示视频的时间一致性和空间对齐。代码生成模块将计划转化为可执行代码,而代码反思模块则验证和细化生成的代码以确保其正确性与生成的计划一致。这两个反思模块共同使agent能够检测并纠正计划生成和代码生成中的错误,提高了在具有复杂时间和空间依赖关系的任务中的性能。为支持系统化评估,我们引入LongVILBench,一个包含300个人类演示的基准,动作序列最长可达18步。LongVILBench强调跨多种任务类型的时空复杂性。实验结果表明,现有方法在该基准上表现不佳,而我们新的框架在长时程视觉模仿学习中建立了强基准。

关键词

引用

@article{arxiv.2509.05367,
  title  = {Between a Rock and a Hard Place: The Tension Between Ethical Reasoning and Safety Alignment in LLMs},
  author = {Shei Pern Chua and Zhen Leng Thai and Kai Jun Teh and Xiao Li and Qibing Ren and Xiaolin Hu},
  journal= {arXiv preprint arXiv:2509.05367},
  year   = {2026}
}