中文

弥合文本-视频检索中的信息不对称:面向数据的方法

计算机视觉与模式识别 2025-03-11 v2 信息检索

摘要

随着在线视频内容的快速增长,文本-视频检索(TVR)任务变得越来越重要。TVR 中的一个关键挑战是视频与文本之间的信息不对称:视频本身包含更丰富的信息,而其文本描述往往只能捕捉到这种复杂性的片段。本文引入了一种新颖的面向数据的方法框架来弥合这一差距,通过丰富文本表示以更好地匹配视频内容的丰富性。在训练期间,视频被分割为事件级片段并添加描述,以确保全面覆盖。在检索期间,大语言模型(LLM)生成语义多样的查询以捕捉更广泛的可能匹配。为了提高检索效率,我们提出了一种查询选择机制,用于识别最相关且最多样的查询,在降低计算成本的同时提高准确率。我们的方法在多个基准测试上取得了最先进的结果,展示了面向数据的方法在解决 TVR 中信息不对称方面的强大能力。这项工作为利用数据改进跨模态检索的新研究铺平了道路。

关键词

引用

@article{arxiv.2408.07249,
  title  = {Bridging Information Asymmetry in Text-video Retrieval: A Data-centric Approach},
  author = {Zechen Bai and Tianjun Xiao and Tong He and Pichao Wang and Zheng Zhang and Thomas Brox and Mike Zheng Shou},
  journal= {arXiv preprint arXiv:2408.07249},
  year   = {2025}
}

备注

Accepted by ICLR 2025