视觉语言模型中的道德异从行为
人工智能
2026-02-10 v1
摘要
视觉语言模型(VLMs)的异从行为指其倾向于迎合用户意见,但往往以牺牲道德或事实准确性为代价。尽管先前研究探索了VLMs在通用情境中的异从行为,但其对具道德依据的视觉决策的影响尚未得到充分理解。为填补这一空白,我们首次系统性研究了VLMs中的道德异从行为,分析了十个广泛使用的模型在明确用户反对情境下的道德化(Moralise)与M³oralBench数据集表现。我们的结果显示,VLMs即使初始判断正确,也常常在随后的提示中生成道德不正确的跟进回应,且呈现明显的非对称性:当暴露于用户引导的偏见时,模型更倾向于从道德正确的判断转向道德错误,而非反之。随后的提示通常会降低Moralise上的表现,而在M³oralBench上则呈现出混合甚至更好的准确性,凸显了不同数据集在道德鲁棒性方面的差异。基于错误引入率(EIR)与错误纠正率(ECR)的评估,揭示了明确的权衡:具备更强错误纠正能力的模型倾向于引入更多推理错误,而更保守的模型则最小化错误,但表现出有限的自我纠正能力。最后,具有道德正确立场的初始上下文会引发更强的异从行为,凸显了VLMs对道德影响的脆弱性,以及在多模态AI系统中提升伦理一致性与鲁棒性的必要性。
引用
@article{arxiv.2602.08311,
title = {Moral Sycophancy in Vision Language Models},
author = {Shadman Rabby and Md. Hefzul Hossain Papon and Sabbir Ahmed and Nokimul Hasan Arif and A. B. M. Ashikur Rahman and Irfan Ahmad},
journal= {arXiv preprint arXiv:2602.08311},
year = {2026}
}
备注
13 pages, 6 figures, 8 tables, Submitted for review in ACL