ConViS-Bench:通过语义概念估计视频相似度
计算机视觉与模式识别
2025-09-24 v1
摘要
两段视频相似意味着什么?如果根据所描绘的动作来判断,视频可能看起来相似;但如果根据拍摄地点来评估,则可能完全不同。人类在比较视频时自然会考虑不同方面,但这种能力尚未得到深入研究,并对通常依赖宽泛全局相似度分数的模型构成了挑战。具备视频理解能力的大型多模态模型(LMM)为在比较视频任务中利用自然语言开辟了新机遇。我们引入了基于概念的视频相似度估计(ConViS),这是一项新颖的任务,通过在一组预定义的关键语义概念上计算可解释的相似度分数来比较视频对。ConViS 允许对视频相似度进行类人推理,并支持诸如概念条件化视频检索等新应用。为支持该任务,我们还引入了 ConViS-Bench,一个包含跨越多个领域的精心标注视频对的新基准。每对视频都附有概念级相似度分数以及描述差异和相似性的文本。此外,我们在 ConViS 上对几个 SOTA 模型进行了基准测试,提供了关于其与人类判断对齐程度的见解。我们的结果揭示了在 ConViS 上的显著性能差异,表明某些概念对估计视频相似度构成了更大的挑战。我们相信 ConViS-Bench 将成为推进语言驱动视频理解研究的宝贵资源。
引用
@article{arxiv.2509.19245,
title = {ConViS-Bench: Estimating Video Similarity Through Semantic Concepts},
author = {Benedetta Liberatori and Alessandro Conti and Lorenzo Vaquero and Yiming Wang and Elisa Ricci and Paolo Rota},
journal= {arXiv preprint arXiv:2509.19245},
year = {2025}
}
备注
Accepted to NeurIPS 2025