中文

我能相信你的回答吗?视觉接地的视频问答

计算机视觉与模式识别 2024-04-02 v2 人工智能 多媒体

摘要

我们研究视觉接地的视频问答(VideoQA),以回应利用预训练技术进行视频-语言理解的新兴趋势。具体而言,通过迫使视觉-语言模型(VLMs)在回答问题的同时提供视觉证据,我们试图确定此类技术的预测在多大程度上真正锚定于相关视频内容,而非来自语言或无关视觉上下文的伪相关。为此,我们构建了NExT-GQA——NExT-QA的扩展,包含与原始问答对绑定的10.5K个时间接地(或定位)标签。借助NExT-GQA,我们审视了一系列最先进的VLMs。通过事后注意力分析,我们发现尽管这些模型具有较强的QA性能,却极不擅长证实答案。这暴露了当前VLMs在进行可靠预测方面的局限性。作为补救,我们进一步探索并提出了一种通过高斯掩码优化与跨模态学习的接地QA方法。基于不同骨干网络的实验表明,该接地机制同时改善了接地与QA。通过这些努力,我们旨在推动VQA系统中可信赖的VLMs的发展。我们的数据集与代码可在 https://github.com/doc-doc/NExT-GQA 获取。

关键词

引用

@article{arxiv.2309.01327,
  title  = {Can I Trust Your Answer? Visually Grounded Video Question Answering},
  author = {Junbin Xiao and Angela Yao and Yicong Li and Tat Seng Chua},
  journal= {arXiv preprint arXiv:2309.01327},
  year   = {2024}
}

备注

Accepted to CVPR'24. (Compared with preprint version, we mainly improve the presentation, discuss more related works, and extend experiments in Appendix.)