Q2E: 用于零样本多语言文本到视频检索的查询到事件分解
计算与语言
2025-11-17 v2 计算机视觉与模式识别
摘要
近期方法已展示出从大型语言模型(LLMs)和视觉语言模型(VLMs)中提取和利用参数化知识的出色能力。在本工作中,我们考虑如何通过自动提取关于复杂现实事件的潜在参数化知识,来改进对相关视频的识别与检索。我们提出 Q2E:一种用于零样本多语言文本到视频检索的查询到事件分解方法,可跨数据集、领域、LLMs 或 VLMs 进行适配。我们的方法表明,通过利用 LLMs 和 VLMs 中嵌入的知识对查询进行分解,可以增强对否则过于简化的人类查询的理解。我们还展示了如何将该方法应用于基于视觉和基于语音的输入。为了融合这种多样的多模态知识,我们采用基于熵的融合评分进行零样本融合。通过在两个多样化数据集和多种检索指标上的评估,我们证明 Q2E 优于多个最先进基线。我们的评估还表明,整合音频信息可以显著改善文本到视频检索。我们已发布代码和数据供未来研究使用。
引用
@article{arxiv.2506.10202,
title = {Q2E: Query-to-Event Decomposition for Zero-Shot Multilingual Text-to-Video Retrieval},
author = {Shubhashis Roy Dipta and Francis Ferraro},
journal= {arXiv preprint arXiv:2506.10202},
year = {2025}
}
备注
Accepted in IJCNLP-AACL 2025 (also presented in MAGMAR 2025 at ACL 2025)