深入探索:层次化视觉感知以提升视频文本检索鲁棒性
计算机视觉与模式识别
2026-01-21 v1 多媒体
摘要
视频文本检索(VTR)旨在使用自然语言查询定位相关视频。当前方法往往基于预训练模型如 CLIP,受限于视频固有的冗余性及其依赖粗糙的最终层特征,限制了匹配精度。为此,我们引入 HVP-Net(层次化视觉感知网络),一个从视觉编码器多个中间层提取并细化特征的框架。我们的方案在不同语义层次从原始 patch-tokens 中逐步提炼关键视觉概念,减轻冗余性同时保留对齐所必需的关键细节。这一结果导致更稳健的视频表征,为 MSRVTT、DiDeMo 和 ActivityNet 等具有挑战性的基准带来了新的最先进性能。我们的工作验证了利用层次化特征推进视频文本检索的有效性。我们的代码已公开,访问 https://github.com/boyun-zhang/HVP-Net。
引用
@article{arxiv.2601.12768,
title = {Delving Deeper: Hierarchical Visual Perception for Robust Video-Text Retrieval},
author = {Zequn Xie and Boyun Zhang and Yuxiao Lin and Tao Jin},
journal= {arXiv preprint arXiv:2601.12768},
year = {2026}
}