用于改进长视频理解的可控混合描述器
计算机视觉与模式识别
2025-11-11 v4 人工智能
摘要
视频数据,尤其是长视频,极其稠密且高维。基于文本的视频内容摘要提供了一种将查询相关内容表示为比原始视频更紧凑方式。此外,文本表示容易被最先进的大语言模型 (LLM) 所消化,这使其能够回答关于视频内容的复杂自然语言查询。为解决此问题,我们依赖于视频描述器对较短视频块进行渐进式构建文本记忆,其中空间-时间建模在计算上是可行的。我们探索了提高仅由短视频描述组成的活动日志质量的方法。由于视频描述倾向于聚焦于人类动作,而问题可能涉及场景中的其他信息,我们寻求使用视觉语言模型 (VLM) 对记忆进行静态场景描述的补充。我们的视频理解系统依赖于 LaViLa 视频描述器结合 LLM 来回答关于视频的问题。我们首先探索了将视频划分为有意义段落的不同方法,以便文本描述更准确地反映视频内容的结构。此外,我们使用 LLaVA VLM 将静态场景描述整合到描述管道中, resulting in 更详细、更完整的描述日志,并扩展了可从文本记忆中回答的问题范围。最后,我们成功地微调了 LaViLa 视频描述器以产生动作和场景描述,显著提高了描述管道的效率,相较于使用单独的描述模型处理两个任务。我们的模型,可控混合描述器,可根据信号视频中场景变化的特殊输入标记在不同类型的描述之间交替。
引用
@article{arxiv.2507.17047,
title = {Controllable Hybrid Captioner for Improved Long-form Video Understanding},
author = {Kuleen Sasse and Efsun Sarioglu Kayi and Arun Reddy},
journal= {arXiv preprint arXiv:2507.17047},
year = {2025}
}