开放式且知识密集型的视频问答
信息检索
2025-02-19 v2
摘要
需要视觉内容之外外部知识的视频问答仍然是人工智能系统面临的一项重大挑战。尽管模型能够基于直接的视觉观察有效地回答问题,但在面对需要更广泛背景知识的问题时,它们往往会陷入困境。为了解决这一局限性,我们通过多模态检索增强生成的视角研究了知识密集型视频问答(KI-VideoQA),特别关注于处理开放式问题,而不仅仅是多项选择格式。我们的综合分析使用前沿的检索和视觉语言模型检查了各种检索增强方法,测试了零样本和微调配置。我们研究了几个关键维度:不同信息源与模态之间的相互作用、整合多样化多模态上下文的策略,以及查询构造与检索结果利用之间的动态关系。我们的发现表明,尽管检索增强在提升模型性能方面显示出前景,但其成功在很大程度上取决于所选的模态和检索方法。该研究还强调了查询构造和检索深度优化在有效知识整合中的关键作用。通过我们提出的方法,我们在 KnowIT VQA 数据集的多项选择题上实现了 17.5% 的显著准确率提升,确立了新的 SOTA 性能水平。
引用
@article{arxiv.2502.11747,
title = {Open-Ended and Knowledge-Intensive Video Question Answering},
author = {Md Zarif Ul Alam and Hamed Zamani},
journal= {arXiv preprint arXiv:2502.11747},
year = {2025}
}