通过细粒度视频故事生成实现长视频理解
计算机视觉与模式识别
2024-12-12 v2
摘要
长视频理解已成为计算机视觉中的关键任务,推动了从监控到内容检索等众多应用的发展。现有视频理解方法在处理长视频理解时存在两个挑战:复杂的长程上下文关系建模和冗余信息的干扰。为解决这些挑战,我们提出了细粒度视频故事生成(Fine-Detailed Video Story, FDVS),将长视频解释为详细的文本表示。具体而言,为实现对长时序内容的细粒度建模,我们提出了从片段到视频逐步解释视频内容的自下而上视频解释机制。为避免视频中冗余信息的干扰,我们引入了语义冗余减少机制,在视觉和文本水平上消除冗余信息。我们的方法将长视频转换为包含多粒度视频信息的层次化文本表示。通过这些表示,FDVS 可用于各种任务而无需任何微调。我们在覆盖三个任务的八个数据集上评估了所提出的方法。结果表明,该方法有效且具有广泛的适用性。
引用
@article{arxiv.2412.06182,
title = {Towards Long Video Understanding via Fine-detailed Video Story Generation},
author = {Zeng You and Zhiquan Wen and Yaofo Chen and Xin Li and Runhao Zeng and Yaowei Wang and Mingkui Tan},
journal= {arXiv preprint arXiv:2412.06182},
year = {2024}
}