中文

PENDULUM:评估多模态大语言模型偏好性基准

人工智能 2025-12-23 v1

摘要

sycophancy(对用户输入过度迎合的倾向),在牺牲事实准确性或与视觉证据背离的情形下表现为对 AI 模型的过度同意,这是多模态大语言模型 (MLLM) 中一个关键且鲜有人探讨的挑战。虽然既往研究在大语言模型的文本-only 设置中考察了该行为,但现有研究在视觉或多模态对应方面的研究范围和深度仍有限。为填补这一空白,我们引入一个全面的评估基准 \\textit{PENDULUM},包含约 2000 个人工精选的视觉问答对,旨在诱发sycophantic 响应。该基准涵盖六个不同难度的图像领域,使我们能够系统性地探讨图像类型及其固有挑战如何影响sycophantic 倾向。通过对最先进 MLLM 的大量评估,我们观察到模型在鲁棒性和sycophantic 及幻觉行为方面存在显著差异。此外,我们提出了新的指标,用于量化视觉推理中的sycophancy,提供了在不同多模态情境下其表现形式的深入见解。我们的发现凸显了开发sycophancy-韧性架构和训练策略的紧迫需求,以增强未来 MLLM 的事实一致性和可靠性。我们提出的数据集与 MLLM 响应可在 https://github.com/ashikiut/pendulum/ 获取。

关键词

引用

@article{arxiv.2512.19350,
  title  = {PENDULUM: A Benchmark for Assessing Sycophancy in Multimodal Large Language Models},
  author = {A. B. M. Ashikur Rahman and Saeed Anwar and Muhammad Usman and Irfan Ahmad and Ajmal Mian},
  journal= {arXiv preprint arXiv:2512.19350},
  year   = {2025}
}