VISTA:通过视频时空增强提升长时段和高分辨率视频理解
计算机视觉与模式识别
2024-12-03 v1
摘要
当前的大型多模态模型(LMM)在处理和理解长时段或高分辨率视频时面临重大挑战,这主要源于缺乏高质量数据集。为从数据中心的角度解决此问题,我们提出了 VISTA,一个简单而有效的视频时空增强框架,通过视频描述数据集合成长时段和高分辨率视频指令跟随对。VISTA 对视频进行时空组合,创建具有延长时长和增强分辨率的合成视频,随后生成针对这些新合成视频的问答对。基于此范式,我们开发了七种视频增强方法,构建了 VISTA-400K 数据集,旨加强长时段和高分辨率视频理解。对各种视频 LMM 进行微调后,在四个具有挑战性的长视频理解基准测试中平均提升了 3.3%。此外,我们引入了首个综合性的高分辨率视频理解基准测试 HRVideoBench,微调后的模型在该基准测试上实现了 6.5% 的性能提升。这些结果凸显了我们框架的有效性。
引用
@article{arxiv.2412.00927,
title = {VISTA: Enhancing Long-Duration and High-Resolution Video Understanding by Video Spatiotemporal Augmentation},
author = {Weiming Ren and Huan Yang and Jie Min and Cong Wei and Wenhu Chen},
journal= {arXiv preprint arXiv:2412.00927},
year = {2024}
}
备注
Project Page: https://tiger-ai-lab.github.io/VISTA/