中文

通过协同提示技术赋能大语言模型进行持续视频问答

计算机视觉与模式识别 2025-01-20 v2 计算与语言

摘要

近年来,随着在线视频内容的快速增长,静态视频问答 (VideoQA) 模型在固定数据集上训练的局限性日益凸显,这些模型难以适应新可用内容所提出的新问题或任务。在本文中,我们探索了在持续学习框架内进行 VideoQA 的新挑战,经验性地识别出一个关键问题:为一系列任务微调大语言模型 (LLM) 常常导致灾难性遗忘。为此,我们提出了协同提示技术 (Collaborative Prompting, ColPro),集成特定问题约束提示、知识获取提示和视觉时序感知提示。这些提示旨在捕获 VideoQA 中的文本问题语境、视觉内容和视频时序动态,这是先前研究中较少关注的视角。在 NExT-QA 和 DramaQA 数据集上的实验结果表明,ColPro 的性能优于现有方法,在 NExT-QA 上达到 55.14% 的准确率,在 DramaQA 上达到 71.24% 的准确率,凸显了其实际意义和有效性。

关键词

引用

@article{arxiv.2410.00771,
  title  = {Empowering Large Language Model for Continual Video Question Answering with Collaborative Prompting},
  author = {Chen Cai and Zheng Wang and Jianjun Gao and Wenyang Liu and Ye Lu and Runzhong Zhang and Kim-Hui Yap},
  journal= {arXiv preprint arXiv:2410.00771},
  year   = {2025}
}

备注

Accepted by main EMNLP 2024