通过多模态大语言模型评估视频问答基准中的模态偏差
机器学习
2024-12-23 v2 人工智能
计算与语言
摘要
多模态大语言模型(MLLM)能够同时处理视觉、文本和听觉数据,捕捉补充人类分析的洞察力。然而,现有的视频问答(VidQA)基准和数据集常常偏向单一模态,尽管该任务需要高度的综合推理能力才能整合多种模态来回答查询。本文引入模态重要性得分(MIS)来识别此类偏差。它旨在评估哪种模态嵌入了回答问题所必需的信息。此外,我们提出了一种创新方法,使用最先进的MLLM来估计模态重要性,可作为人类模态感知判断的代理。通过该MIS,我们展示了单模态偏差的存在以及 genuinely 多模态问题在现有数据集中的稀缺。我们进一步通过多项消除实验来验证模态重要性得分,以评估MLLM在排列特征集上的性能。我们的结果表明,当前模型由于现有数据集中的模态不平衡而未能有效整合信息。我们提出的MLLM派生的MIS可指导构建模态平衡的数据集,以促进多模态学习并增强MLLM理解和利用跨模态协同关系的能力。
引用
@article{arxiv.2408.12763,
title = {Assessing Modality Bias in Video Question Answering Benchmarks with Multimodal Large Language Models},
author = {Jean Park and Kuk Jin Jang and Basam Alasaly and Sriharsha Mopidevi and Andrew Zolensky and Eric Eaton and Insup Lee and Kevin Johnson},
journal= {arXiv preprint arXiv:2408.12763},
year = {2024}
}