EagleNet:面向文本-视频检索的能感知细粒度关系学习网络
计算机视觉与模式识别
2026-04-02 v3
摘要
文本-视频检索任务由于最近大规模视觉语言预训练模型的发展而取得了显著进步。传统方法主要关注视频表征或跨模态对齐,而近期研究则转向增强文本表达性以更好地匹配视频中丰富的语义。然而,这些方法仅利用文本与帧/视频之间的交互,忽略了视频内部帧之间丰富的相互作用,导致最终扩展后的文本无法捕获帧的上下文信息,从而在文本和视频之间产生差异。为此,我们引入能感知细粒度关系学习网络(EagleNet),以生成准确且具有上下文感知的丰富文本嵌入。具体而言,提出的细粒度关系学习机制(FRL)首先通过生成的文本候选项和帧构建文本-帧图,然后学习文本与帧之间的关系,这些关系最终用于聚合文本候选项,生成包含帧上下文信息的丰富文本嵌入。为进一步提高FRL中的细粒度关系学习,我们设计能感知匹配(EAM)以建模文本-帧交互的能量,从而准确捕获真实文本-视频对的分布。此外,为更有效的跨模态对齐和稳定训练,我们将常用的基于softmax的对比损失替换为sigmoid损失。广泛的实验结果表明,EagleNet在MSRVTT、DiDeMo、MSVD和VATEX上均表现优异。代码可在 https://github.com/draym28/EagleNet 查看。
引用
@article{arxiv.2603.25267,
title = {EagleNet: Energy-Aware Fine-Grained Relationship Learning Network for Text-Video Retrieval},
author = {Yuhan Chen and Pengwen Dai and Chuan Wang and Dayan Wu and Xiaochun Cao},
journal= {arXiv preprint arXiv:2603.25267},
year = {2026}
}
备注
Accepted at CVPR 2026