中文

StoryTeller:通过全局音视频角色识别改进长视频描述

计算机视觉与模式识别 2025-07-31 v3 人工智能

摘要

现有大型视觉语言模型(LVLM)主要局限于处理短视频(几秒钟),难以生成跨越数分钟或更长的扩展视频的连贯描述。长视频描述引入了新挑战,如一致的角色识别和融合视觉与音频信息的情节级描述。为解决这些问题,我们发现音视频角色识别——将角色名称与每句对话匹配——是关键因素。我们提出 StoryTeller,一种生成长视频稠密描述的系统,融合低层视觉概念和高层情节信息。StoryTeller 使用一个整合视觉、音频和文本模态的多模态大语言模型,对分钟级视频片段执行音视频角色识别。结果随后输入 LVLM 以增强视频描述的一致性。我们在电影描述任务上验证了该方法,并引入 MovieStory101 数据集,包含三分钟电影片段的稠密描述。为评估长视频描述,我们创建了 StoryQA,即针对 MovieStory101 测试集的大量多项选择题。通过将描述输入 GPT-4 回答这些问题,以准确率作为自动评估指标。实验表明,StoryTeller 在 StoryQA 上超越所有开源和闭源基线,比最强基线 Gemini-1.5-pro 准确率高 9.5%,在人工并列评估中具有 +15.56% 的优势。此外,引入 StoryTeller 的音视频角色识别提升了所有视频描述模型的性能,Gemini-1.5-pro 和 GPT-4o 在 StoryQA 上的准确率分别相对提升 5.5% 和 13.0%。

关键词

引用

@article{arxiv.2411.07076,
  title  = {StoryTeller: Improving Long Video Description through Global Audio-Visual Character Identification},
  author = {Yichen He and Yuan Lin and Jianchao Wu and Hanchong Zhang and Yuchen Zhang and Ruicheng Le},
  journal= {arXiv preprint arXiv:2411.07076},
  year   = {2025}
}