SeViCES: 统一语义-视觉证据共识以实现长视频理解
计算机视觉与模式识别
2025-10-24 v1
摘要
长视频理解因其内容复杂、多样且时间上分散而仍然具有挑战性。尽管视频大语言模型可以处理长达数十分钟的视频,但将其应用于真正长的序列在计算上是禁止的,并且常常导致不聚焦或不一致的推理。一个有前景的解决方案是仅选择信息量最大的帧,然而现有方法通常忽略时间依赖性或依赖单模态证据,限制了它们提供完整且与查询相关上下文的能力。我们提出了一种语义-视觉共识证据选择(SeViCES)框架,用于有效且可靠的长视频理解。SeViCES无需训练且与模型无关,并引入了两个关键组件。语义-视觉共识帧选择(SVCFS)模块通过以下方式选择帧:(1)一个时间感知的语义分支,利用大语言模型对字幕进行推理,以及(2)一个聚类引导的视觉分支,通过互信息将嵌入与语义分数对齐。答案共识精炼(ACR)模块通过融合证据和约束答案空间,进一步解决基于语义和基于视觉的预测之间的不一致性。在长视频理解基准上的大量实验表明,SeViCES在准确性和鲁棒性方面始终优于最先进的方法,证明了共识驱动的证据选择对于视频大语言模型的重要性。
引用
@article{arxiv.2510.20622,
title = {SeViCES: Unifying Semantic-Visual Evidence Consensus for Long Video Understanding},
author = {Yuan Sheng and Yanbin Hao and Chenxu Li and Shuo Wang and Xiangnan He},
journal= {arXiv preprint arXiv:2510.20622},
year = {2025}
}