中文

面向视频-文本检索的专家化描述自动增强

计算机视觉与模式识别 2025-04-09 v3 人工智能 机器学习

摘要

视频-文本检索一直受困于由视频的个性化和不充分文本描述所导致的信息不匹配。两种模态间的巨大信息鸿沟阻碍了有效的跨模态表示对齐,导致检索结果模糊不清。尽管已有文本改写方法被提出以拓宽文本表达,但由于语义丰富度不足,文本表示空间难以扩展,模态鸿沟依然显著。相反,本文转向增强视觉呈现,通过描述生成使视频表达更接近文本表示,从而促进视频-文本匹配。虽然多模态大语言模型(mLLM)已展现出将视频内容转换为文本的强大能力,但精心设计的提示对于确保生成描述的合理性和完整性至关重要。因此,本文提出了一种自动描述增强方法,通过自学习提升增强描述的表达质量并减少经验主义。此外,还设计并引入了一种专家化描述选择机制,为每个视频定制增强描述,进一步挖掘描述增强的利用潜力。我们的方法完全由数据驱动,不仅省去了繁重的数据收集和计算工作,还通过规避词典依赖并引入个性化匹配来提高自适应性。该方法在各种基准测试上取得了最先进的结果,验证了其优越性,具体在 MSR-VTT 上达到了 68.5% 的 Top-1 召回准确率,在 MSVD 上达到 68.1%,在 DiDeMo 上达到 62.0%。我们的代码已公开在 https://github.com/CaryXiang/ECA4VTR。

关键词

引用

@article{arxiv.2502.02885,
  title  = {Expertized Caption Auto-Enhancement for Video-Text Retrieval},
  author = {Baoyao Yang and Junxiang Chen and Wanyun Li and Wenbin Yao and Yang Zhou},
  journal= {arXiv preprint arXiv:2502.02885},
  year   = {2025}
}