Judge Before Answer: MLLM 能否辨别问题中的错误前提?
计算与语言
2025-10-14 v1 人工智能
摘要
多模态大语言模型(MLLM)在近年来取得了惊人的进展。尽管如此,MLLM 仍然对错误前提问题十分脆弱。然而,现有针对该问题的基准测试范围有限:它们往往缺乏细致的分类,覆盖范围不足,从而未能对模型识别错误前提的能力进行严格评估。为弥合这一差距,我们引入了构建全面错误前提问题基准的自动化管道。我们的方法根据识别前提所需的能力,将前提系统性地分为三类十三种子类型, resulting in the JBA 数据集。结果表明,当前 MLLM 在错误前提识别方面仍存在挑战。基于此基准,我们进一步提出了一种针对 MLLM 检测错误前提的识别增强框架。大量实验表明,使用我们框架训练的模型在错误前提识别方面实现了显著提升。
引用
@article{arxiv.2510.10965,
title = {Judge Before Answer: Can MLLM Discern the False Premise in Question?},
author = {Jidong Li and Lingyong Fang and Haodong Zhao and Sufeng Duan and Gongshen Liu},
journal= {arXiv preprint arXiv:2510.10965},
year = {2025}
}