面向部分相关视频检索的模糊度受限文本-视频表示学习
计算机视觉与模式识别
2025-06-10 v1 人工智能
摘要
部分相关视频检索(PRVR)旨�检索特定片段与给定文本查询相关的视频。典型的 PRVR 训练过程假设文本查询仅与一个视频相关。然而,我们指出文本与视频内容之间存在固有的模糊度,因其概念范围而异,并提出一种将模糊度纳入模型学习过程的框架。具体而言,我们提出了模糊度受限表示学习(ARL)以解决模糊的文本-视频对。首先,ARL 基于两个标准检测模糊对:不确定性与相似性。不确定性代表实例是否包含数据集中常见的共享上下文,而相似性指示成对的语义重叠。随后,针对检测到的模糊对,ARL 通过层次化多正例对比学习和双向三角损失来学习语义关系。此外,我们深入研究视频实例内部的细粒度关系。不同于通常在文本-视频层面进行训练,仅提供成对信息,我们关注同一未剪辑视频帧内的固有模糊度,这通常包含多个上下文。这允许我们进一步在文本-帧层面增强学习。最后,我们提出跨模型模糊度检测,以消除单一模型用于检测其训练的模糊对所产生的误差传播。通过综合所有组件,我们的方法在 PRVR 中展现出效能。
引用
@article{arxiv.2506.07471,
title = {Ambiguity-Restrained Text-Video Representation Learning for Partially Relevant Video Retrieval},
author = {CH Cho and WJ Moon and W Jun and MS Jung and JP Heo},
journal= {arXiv preprint arXiv:2506.07471},
year = {2025}
}
备注
Accepted to AAAI 2025