弥合鸿沟:一种用于时刻检索与高亮检测的统—视频理解框架
计算机视觉与模式识别
2023-11-29 v1 人工智能
摘要
视频时刻检索(MR)与高亮检测(HD)因视频分析需求的增长而备受关注。近期方法将MR与HD视为相似的视频定位问题,并用基于transformer的架构一并解决。然而,我们观察到MR与HD的侧重点不同,前者需要感知局部关系,后者优先理解全局上下文。因此,缺乏任务特定设计不可避免地会导致在关联两任务内在特性上的局限。为解决该问题,我们提出统—视频理解框架(UVCOM)以弥合鸿沟并有效联合求解MR与HD。通过对多粒度上模态内与模态间的渐进式整合,UVCOM实现了处理视频时的全面理解。此外,我们提出多方面对比学习,通过良好对齐的多模态空间来巩固局部关系建模与全局知识积累。在QVHighlights、Charades-STA、TACoS、YouTube Highlights和TVSum数据集上的大量实验证明了UVCOM的有效性与合理性,其以显著优势超越最先进方法。
引用
@article{arxiv.2311.16464,
title = {Bridging the Gap: A Unified Video Comprehension Framework for Moment Retrieval and Highlight Detection},
author = {Yicheng Xiao and Zhuoyan Luo and Yong Liu and Yue Ma and Hengwei Bian and Yatai Ji and Yujiu Yang and Xiu Li},
journal= {arXiv preprint arXiv:2311.16464},
year = {2023}
}