文本主导:多模态意图检测中模态偏置的研究
计算与语言
2025-10-22 v3
摘要
多模态数据(整合文本、音频和视觉)的兴起为研究意图检测等多模态任务提供了新机遇。本文考察了大语言模型(LLM)和非LLM(包括文本唯一模型和多模态模型)在多模态意图检测任务中的效果。我们的研究表明,文本唯一LLM Mistral-7B在MIntRec-1数据集上约优于9%,在MIntRec2.0数据集上约优于4%。这种优势来自于这些数据集中超过90%的样本需要文本输入(单独或与其他模态组合)才能正确分类。我们通过人类评估确认了这些数据集的模态偏置。随后,我们提出一个去偏框架,去偏后,MIntRec-1中超过70%的样本被移除,MIntRec2.0中超过50%的样本被移除,导致所有模型在准确率上显著下降,其中较小的多模态融合模型受影响最大,准确率下降超过50-60%。进一步,我们通过经验分析分析不同模态在特定上下文中的相关性。我们的发现凸显了多模态意图数据集中模态偏置所带来的挑战,强调了为有效评估多模态模型需要无偏数据集。
引用
@article{arxiv.2508.16122,
title = {Text Takes Over: A Study of Modality Bias in Multimodal Intent Detection},
author = {Ankan Mullick and Saransh Sharma and Abhik Jana and Pawan Goyal},
journal= {arXiv preprint arXiv:2508.16122},
year = {2025}
}
备注
EMNLP 2025 Main Conference Full Paper