多模态因果推理基准:挑战视觉大语言模型辨识跨模态因果关联
计算机视觉与模式识别
2025-05-28 v4 人工智能
摘要
多模态大语言模型 (MLLM) 在复杂文本推理任务中展示了卓越的链式思考 (CoT) 推理能力, 但在关键线索隐藏在视觉细节中的情况下, 这些因果关系是否仍保持简单?若非, 可能影响跨模态泛化的关键因素是什么?我们能否有效提升其在文本与视觉双模态中的鲁棒因果推理能力?为此, 本文引入 MuCR - 一个新颖的多模态因果推理基准, 利用合成双胞胎图像与文本对来挑战 MLLM。此外, 我们从多个角度开发了针对性指标, 包括图像层面匹配、短语层面理解和句子层面解释, 以全面评估 MLLM 的理解能力。我们的实验表明, 当前 MLLM 在纯文本环境中的多模态因果推理能力不足。此外, 我们发现跨图像识别视觉线索是有效跨模态泛化的关键。最后, 我们提出了 VcCoT 策略以更好地突出视觉线索, 我们的结果确认其在提升多模态因果推理方面的有效性。项目地址: https://github.com/Zhiyuan-Li-John/MuCR
引用
@article{arxiv.2408.08105,
title = {Multimodal Causal Reasoning Benchmark: Challenging Vision Large Language Models to Discern Causal Links Across Modalities},
author = {Zhiyuan Li and Heng Wang and Dongnan Liu and Chaoyi Zhang and Ao Ma and Jieting Long and Weidong Cai},
journal= {arXiv preprint arXiv:2408.08105},
year = {2025}
}
备注
ACL2025 Findings