中文

文本代理:将文本-视频检索中的1:N关系分解为N个1:1关系

计算机视觉与模式识别 2024-12-17 v2 信息检索 多媒体

摘要

文本-视频检索(TVR)近年来取得了显著进展,得益于预训练模型和大型语言模型(LLM)的运用。尽管如此,在TVR中实现准确匹配仍然具有挑战性,这源于视频和文本模态之间的固有差异以及数据表示的不规则性。本文提出了 Text-Video-ProxyNet(TV-ProxyNet),一种新型框架,旨在将传统的TVR中的1:N关系分解为N个独立的1:1关系。通过将单个文本查询替换为一系列文本代理,TV-ProxyNet 不仅扩大了查询范围,还实现了更精确的扩展。每个文本代理都通过我们称为导演(director)和鞭子(dash)的机制进行精细迭代过程控制,这些机制分别调节代理相对于原始文本查询的方向和距离。这一设置不仅有助于更精确的语义对齐,还有效管理了多模态数据中固有的差异和噪声。我们在三个代表性视频-文本检索基准测试上进行了实验,包括MSRVTT、DiDeMo和ActivityNet Captions。结果显示,TV-ProxyNet 在R@1上比基线提高了2.0%至3.3%。在MSRVTT和ActivityNet Captions上实现了最先进的性能,在DiDeMo上比现有方法提高了2.0%,验证了我们方法提升语义映射和降低错误倾向的能力。

关键词

引用

@article{arxiv.2410.06618,
  title  = {Text Proxy: Decomposing Retrieval from a 1-to-N Relationship into N 1-to-1 Relationships for Text-Video Retrieval},
  author = {Jian Xiao and Zhenzhen Hu and Jia Li and Richang Hong},
  journal= {arXiv preprint arXiv:2410.06618},
  year   = {2024}
}