HLFormer:用于增强部分相关视频检索的双曲空间学习
计算机视觉与模式识别
2025-07-29 v2 信息检索
多媒体
摘要
部分相关视频检索(PRVR)旨在解决将未剪裁视频与仅描述其部分内容的文本查询进行匹配的关键挑战。现有方法在欧几里得空间中存在几何失真,时常误表现视频的内在层次结构,并忽视某些层次语义,最终导致时序建模次优。为此,本文提出首个针对PRVR的双曲空间建模框架——HLFormer,利用双曲空间学习弥补欧几里得空间在层次建模能力上的不足。具体而言,HLFormer集成了Lorentz注意力模块与欧几里得注意力模块,对视频嵌入在混合空间中进行编码,借助均值引导自适应交互模块动态融合特征。此外,本文引入部分秩序保持损失,通过Lorentz锥约束强制实现“文本 < 视频”的层次结构。该方法进一步通过强化视频内容与文本查询之间的部分相关性来提升跨模态匹配。大量实验表明,HLFormer超越了当前最先进的方法。代码已发布于 https://github.com/lijun2005/ICCV25-HLFormer。
引用
@article{arxiv.2507.17402,
title = {HLFormer: Enhancing Partially Relevant Video Retrieval with Hyperbolic Learning},
author = {Jun Li and Jinpeng Wang and Chaolei Tan and Niu Lian and Long Chen and Yaowei Wang and Min Zhang and Shu-Tao Xia and Bin Chen},
journal= {arXiv preprint arXiv:2507.17402},
year = {2025}
}
备注
Accepted by ICCV'25. 13 pages, 6 figures, 4 tables