中文

CI w/o TN:无任务名称的上下文注入用于过程规划

计算机视觉与模式识别 2024-02-27 v1 计算与语言

摘要

本文探讨了教学视频中过程规划的挑战,该任务涉及基于视频中的视觉起始和目标观察来创建目标导向的计划。先前的研究通过逐渐减弱的训练监督(从繁重的中间视觉观察或语言指令到任务类别监督)来解决这一问题。然而,随着大型语言模型的出现,即使只给定任务名称,这些模型也能生成详细的计划。在本研究中,我们提出了一种更弱的设置,即不使用任务名称作为监督,这是现有大型语言模型目前无法解决的,因为它们需要包含足够信息的良好提示。具体来说,我们假设先前的中间监督可以作为上下文信息,并且我们使用视觉起始和目标观察的标题作为更廉价的监督形式。这种方法大大降低了标注成本,因为标题可以很容易地通过大型预训练视觉-语言基础模型获得。在技术上,我们应用 BLIP 生成标题作为监督,通过对比学习损失训练上下文特征。之后,上下文特征被馈入生成器以辅助计划生成。我们在两个不同规模的数据集上的实验表明,我们的模型在多个指标上可以达到可比的性能,这验证了我们的假设。

关键词

引用

@article{arxiv.2402.15579,
  title  = {CI w/o TN: Context Injection without Task Name for Procedure Planning},
  author = {Xinjie Li},
  journal= {arXiv preprint arXiv:2402.15579},
  year   = {2024}
}