中文

面向任务规划的多媒体生成式脚本学习

计算与语言 2025-06-11 v3 人工智能 计算机视觉与模式识别

摘要

面向目标的生成式脚本学习旨在生成达成特定目标的后续步骤,这是辅助机器人或人类执行刻板活动的一项基本任务。该过程的一个重要方面是能够以视觉方式捕捉历史状态,其提供了文本未涵盖的详细信息并指导后续步骤。因此,我们提出一项新任务——多媒体生成式脚本学习,通过追踪文本与视觉两种模态下的历史状态来生成后续步骤,并给出首个包含 5,652 个任务与 79,089 个多媒体步骤的基准。该任务在三个方面具有挑战性:捕捉图像中视觉状态的多媒体挑战、执行未见过的任务的归纳挑战,以及覆盖各步骤中不同信息的多样性挑战。我们提出通过选择性多媒体编码器编码视觉状态变化以应对多媒体挑战,利用检索增强解码器从先前观察到的任务迁移知识以克服归纳挑战,并通过优化面向多样性的对比学习目标在各步骤呈现差异化信息。我们定义了评估生成质量与归纳质量的指标。实验结果表明,我们的方法显著优于强基线。

关键词

引用

@article{arxiv.2208.12306,
  title  = {Multimedia Generative Script Learning for Task Planning},
  author = {Qingyun Wang and Manling Li and Hou Pong Chan and Lifu Huang and Julia Hockenmaier and Girish Chowdhary and Heng Ji},
  journal= {arXiv preprint arXiv:2208.12306},
  year   = {2025}
}

备注

21 pages, Accepted by Findings of the Association for Computational Linguistics: ACL 2023, Code and Resources at https://github.com/EagleW/Multimedia-Generative-Script-Learning