MoHoBench:通过不可回答视觉问题评估多模态大型语言模型的诚实度
人工智能
2026-01-14 v4 计算机视觉与模式识别
摘要
最近,多模态大型语言模型(MLLMs)在视觉语言任务中取得了显著进展,但可能产生有害或不可信的内容。尽管已有大量工作致力于探讨语言模型的可信度,但 MLLMs 在面对不可回答视觉问题时的诚实度表现仍鲜有探讨。本工作提出了首个系统性评估 MLLMs 诚实行为的基准。我们将诚实度定义为模型面对不可回答视觉问题时的响应行为,构建了 MoHoBench,即大型 MLLM 诚实基准,包含 12000 以上视觉问答样本,经多阶段筛选和人工验证确保质量。使用 MoHoBench,我们对 28 个流行 MLLMs 进行了诚实度评估并进行了全面分析。我们的发现表明:(1)大多数模型在必要时未能恰当地拒绝作答;(2)MLLMs 的诚实度不仅是语言建模问题,更深受视觉信息的影响,这一发现 necessitates 为多模态诚实度对齐开发专门方法。因此,我们实现了初始的对齐方法,采用监督学习和偏好学习来改善诚实行为,为未来可信 MLLMs 的研究奠定了基础。我们的数据和代码可在 https://github.com/yanxuzhu/MoHoBench 上获取。
引用
@article{arxiv.2507.21503,
title = {MoHoBench: Assessing Honesty of Multimodal Large Language Models via Unanswerable Visual Questions},
author = {Yanxu Zhu and Shitong Duan and Xiangxu Zhang and Jitao Sang and Peng Zhang and Tun Lu and Xiao Zhou and Jing Yao and Xiaoyuan Yi and Xing Xie},
journal= {arXiv preprint arXiv:2507.21503},
year = {2026}
}
备注
AAAI2026 Oral