HVD:面向文本-视频检索的人类视觉驱动视频表示学习
计算机视觉与模式识别
2026-01-23 v1 信息检索
摘要
CLIP的成功推动了文本-视频检索的实质性进展。然而,当前方法常常遭受“盲目”特征交互的困扰,即由于文本查询的稀疏性,模型难以从背景噪声中辨别关键视觉信息。为了弥补这一差距,我们从人类认知行为中汲取灵感,提出了人类视觉驱动(HVD)模型。我们的框架建立了一个由粗到细的对齐机制,包含两个关键组件:帧特征选择模块(FFSM)和块特征压缩模块(PFCM)。FFSM通过选择关键帧来消除时间冗余,模拟了人类的宏观感知能力。随后,PFCM通过先进的注意力机制将块特征聚合为显著的视觉实体,实现了精确的实体级匹配,模拟了微观感知。在五个基准数据集上的大量实验表明,HVD不仅捕捉到了类似人类的视觉焦点,而且达到了最先进的性能。
引用
@article{arxiv.2601.16155,
title = {HVD: Human Vision-Driven Video Representation Learning for Text-Video Retrieval},
author = {Zequn Xie and Xin Liu and Boyun Zhang and Yuxiao Lin and Sihang Cai and Tao Jin},
journal= {arXiv preprint arXiv:2601.16155},
year = {2026}
}
备注
Accepted by ICASSP 2026