轻量注意力特征融合:文本到视频检索的新基线
多媒体
2022-07-28 v3 计算机视觉与模式识别
摘要
本文在文本到视频检索的新背景下重新审视特征融合这一老话题。与以往仅在视频或文本一端考虑特征融合的研究不同,我们旨在统一框架内对两端进行特征融合。我们假设优化特征的凸组合优于通过计算繁重的多头自注意力建模其相关性。我们提出轻量注意力特征融合(LAFF)。LAFF在早晚期阶段以及视频和文本两端均执行特征融合,使其成为利用多样化(现成)特征的强有力方法。LAFF的可解释性可用于特征选择。在五个公开基准集(MSR-VTT、MSVD、TGIF、VATEX和TRECVID AVS 2016-2020)上的大量实验证明LAFF可作为文本到视频检索的新基线。
引用
@article{arxiv.2112.01832,
title = {Lightweight Attentional Feature Fusion: A New Baseline for Text-to-Video Retrieval},
author = {Fan Hu and Aozhu Chen and Ziyue Wang and Fangming Zhou and Jianfeng Dong and Xirong Li},
journal= {arXiv preprint arXiv:2112.01832},
year = {2022}
}
备注
Accepted by ECCV2022