中文

VG-TVP:基于视觉基础文本-视频提示的多模态程序规划

计算机视觉与模式识别 2024-12-17 v1 多媒体

摘要

基于大型语言模型(LLM)的智能体在程序性任务中显示出潜力,但通过文本和视频增强的多模态指令来辅助用户的潜力尚未被充分探索。为填补这一空白,我们提出视觉基础文本-视频提示(VG-TVP)方法,这是一种新颖的基于LLM的多模态程序规划(MPP)框架。它生成连贯的文本和视频程序计划,给定一个指定的高层次目标。主要挑战是实现文本和视觉的信息丰富性、时间连贯性和程序计划的准确性。VG-TVP利用了LLM的零样本推理能力、视频字幕模型的视频到文本生成能力以及扩散模型的文本到视频生成能力。VG-TVP通过提出新颖的融合字幕(FoC)方法并使用文本到视频桥(T2V-B)和视频到文本桥(V2T-B)来改善模态之间的交互。它们允许LLM指导视觉基础文本计划和文本基础视频计划的生成。为解决适合MPP的数据集稀缺问题,我们整理了一个名为日常生活任务程序计划(Daily-PP)的新数据集。我们进行了全面的实验和基准测试,以评估人类偏好(关于文本和视觉信息丰富性、时间连贯性和计划准确性)。我们的VG-TVP方法在Daily-PP数据集上优于单模态基线。

关键词

引用

@article{arxiv.2412.11621,
  title  = {VG-TVP: Multimodal Procedural Planning via Visually Grounded Text-Video Prompting},
  author = {Muhammet Furkan Ilaslan and Ali Koksal and Kevin Qinhong Lin and Burak Satar and Mike Zheng Shou and Qianli Xu},
  journal= {arXiv preprint arXiv:2412.11621},
  year   = {2024}
}

备注

Accepted for The 39th Annual AAAI Conference on Artificial Intelligence 2025 in Main Track, 19 pages, 24 figures