隐藏于显处:多模态 LLM 在欠指定与误定场景中的推理
人工智能
2025-08-26 v2
摘要
多模态大型语言模型日益部署在开放式、真实的现实环境中,这些环境中的输入是杂乱的、欠指定的,且并不总是可信的。与精选的基准测试不同,这些设置经常涉及引用缺失对象或矛盾事实的指令、依赖模糊的引用,或要求不可行的行动。在这种情况下,成功不仅取决于任务执行,还取决于模型检测何时出现隐性错误的能力。本文对当前 MLLM 如何处理此类隐性推理场景进行了系统分析:这些场景中的缺陷没有被明确指出,而必须从上下文中推断。使用一个涵盖四类现实世界失败模式的精选诊断套件,我们评估了六个 MLLM,包括 o3 和 GPT-4o,发现模型经常无法显现隐藏的问题,即使它们具备必要的感知和推理技能。显式提示表明,底层能力存在,但往往为了顺从用户而被抑制。我们进一步表明,简单的推理时干预措施,如谨慎角色提示,特别是要求提出澄清问题,可以显著恢复性能。我们的发现突出了当前 MLLM 中推理能力与行为顺从性之间的持续差距,并提出了使这些模型在欠约束环境中更值得信赖的实用策略。
引用
@article{arxiv.2506.00258,
title = {Hidden in Plain Sight: Reasoning in Underspecified and Misspecified Scenarios for Multimodal LLMs},
author = {Qianqi Yan and Hongquan Li and Shan Jiang and Yang Zhao and Xinze Guan and Ching-Chen Kuo and Xin Eric Wang},
journal= {arXiv preprint arXiv:2506.00258},
year = {2025}
}