HawkEye:用于视频文本大语言模型中将文本 grounding 的训练
计算机视觉与模式识别
2024-03-18 v1 人工智能
计算与语言
摘要
视频文本大语言模型(video-text LLMs)在回答简单视频上的问题和进行对话方面显示出惊人的性能。然而,它们在对长篇复杂视频中的文本查询进行 grounding 时几乎与随机结果相当,几乎没有理解和推理时间信息的能力,而这正是视频与图像最根本的区别。本文提出了 HawkEye,是首批能够以完全文本到文本方式执行时间视频 grounding 的视频文本大语言模型之一。为收集适用于时间视频 grounding 的训练数据,我们构建了 InternVid-G,一个包含分段级描述和负面片段的大规模视频文本语料库,并据此为视频文本大语言模型引入了两种新的时间感知训练目标。我们还提出了一种更稳健、更易于大语言模型学习和遵循的视频中表示片段的粗粒度方法。大量实验表明,HawkEye 在时间视频 grounding 方面表现更好,在其他视频文本任务上与现有视频文本大语言模型相当,这验证了其在视频文本多模态理解方面的优势。
引用
@article{arxiv.2403.10228,
title = {HawkEye: Training Video-Text LLMs for Grounding Text in Videos},
author = {Yueqian Wang and Xiaojun Meng and Jianxin Liang and Yuxuan Wang and Qun Liu and Dongyan Zhao},
journal= {arXiv preprint arXiv:2403.10228},
year = {2024}
}