通过削弱模态融合剖析视频问答Transformer模型中的多模态性
计算机视觉与模式识别
2024-06-10 v3 人工智能
摘要
尽管视频问答(VideoQA)Transformer模型在标准基准上展现出具有竞争力的性能,但其成功背后的原因尚未被充分理解。这些模型是联合从视频和文本中捕获了丰富的多模态结构与动态,还是通过利用偏差与伪特征获得了高分?为此,为提供见解,我们设计了(QUadrant AveraGe,象限平均),一种轻量且非参数的探针,通过削弱模态融合来进行数据集-模型联合的表示分析。我们发现,许多模型在不利用多模态表示的情况下就取得了高性能。为进一步验证QUAG,我们设计了,一种具有受限令牌交互、表达能力较弱的自注意力替代方案。配备QUAG-attention的模型在无需任何微调的情况下,以显著更少的乘法操作取得了相似性能。我们的发现引发了对当前模型学习高度耦合多模态表示能力的质疑。因此,我们设计了(Complements in LAnguage and VIdeo,语言与视频中的互补)数据集,一个通过对真实世界视频进行增强以具备高模态耦合的压力测试数据集。与QUAG的发现一致,我们发现大多数模型在CLAVI上取得了近乎平凡的性能。这再次印证了当前模型在学习高度耦合多模态表示上的局限性,而现有数据集并未对此进行评估(项目页面:https://dissect-videoqa.github.io)。
引用
@article{arxiv.2306.08889,
title = {Dissecting Multimodality in VideoQA Transformer Models by Impairing Modality Fusion},
author = {Ishaan Singh Rawal and Alexander Matyasko and Shantanu Jaiswal and Basura Fernando and Cheston Tan},
journal= {arXiv preprint arXiv:2306.08889},
year = {2024}
}
备注
Accepted at ICML 2024