WISE:基于弱监督的图像分类中多模态 LLM 的分步解释
计算机视觉与模式识别
2025-09-23 v1 计算与语言
摘要
多模态大语言模型 (MLLM) 在视觉-文本推理方面显示出前景,但现有 MCoT 方法依赖于丰富论据的数据集,并主要关注对象间推理,忽视了图像分类中至关重要的视觉内部分析。为此,我们提出了 WISE,即一种弱监督驱动的分步解释方法,通过将概念瓶颈模型 (CBM) 中的概念表示重新构建为在弱监督下的简洁、可解释的推理链,从而为任何图像分类数据集增添 MCoT。跨越十个数据集的实验表明,我们生成的 MCoT 不仅在可解释性上提升了 37%,在用于微调 MLLM 时也带来了分类准确率的提升。我们的工作连接了概念基础的可解释性和生成式 MCoT 推理,为增强 MLLM 在精细视觉理解方面提供了一种可通用的框架。
引用
@article{arxiv.2509.17740,
title = {WISE: Weak-Supervision-Guided Step-by-Step Explanations for Multimodal LLMs in Image Classification},
author = {Yiwen Jiang and Deval Mehta and Siyuan Yan and Yaling Shen and Zimu Wang and Zongyuan Ge},
journal= {arXiv preprint arXiv:2509.17740},
year = {2025}
}
备注
Accepted at EMNLP 2025 (Main)