中文

基于门控注意力机制的音频引导视频表征学习用于视频-文本检索

计算机视觉与模式识别 2025-04-04 v1

摘要

视频-文本检索作为根据文本查询检索视频或反之的任务,是视频理解和多模态信息检索中至关重要的任务。当前该领域的方法主要依赖视觉和文本特征,常常忽略了音频信息,而音频有助于增强对视频内容的整体理解。此外,传统模型在纳入音频时往往盲目利用音频输入,忽略其是否实用,从而导致视频表征次优。为此,我们提出了一种新颖的视频-文本检索框架,音频引导视频表征学习 with Gated Attention (AVIGATE),通过门控注意力机制有效地利用音频线索,选择性地过滤无信息音频信号。此外,我们提出了一种自适应间隔对比损失,用于处理视频与文本之间正负关系本质上不清晰的问题,从而促进更好的视频-文本对齐。我们的广泛实验表明,AVIGATE 在所有公开基准上均实现了最先进的性能。

关键词

引用

@article{arxiv.2504.02397,
  title  = {Learning Audio-guided Video Representation with Gated Attention for Video-Text Retrieval},
  author = {Boseung Jeong and Jicheol Park and Sungyeon Kim and Suha Kwak},
  journal= {arXiv preprint arXiv:2504.02397},
  year   = {2025}
}

备注

Accepted to CVPR 2025