视觉干扰削弱了视觉语言模型中的道德推理
人工智能
2026-03-18 v1
摘要
道德推理是人工智能安全的基本要素,但随着 AI 系统从文本助手演进为具身智能体,跨模态的一致性变得至关重要。当前安全技术在文本上下文中取得成功,但对视觉输入的泛化仍存疑虑。现有道德评估基准仅采用文本格式,缺乏对影响道德决策的变量进行系统性控制。我们展示了视觉输入在最先进(SOTA)视觉语言模型(VLMs)中的道德决策会发生根本性改变,绕过了基于文本的安全机制。我们引入了道德困境模拟(Moral Dilemma Simulation, MDS),该基准基于道德基础理论(Moral Foundation Theory, MFT),通过正交操控视觉变量和情境变量实现机械化分析。评估结果表明,视觉模态激活类似直觉的路径,超越了文本唯一情境中观察到的更明确且更安全的推理模式。这些发现揭示了语言微调安全过滤器在约束视觉处理方面的关键脆弱性,凸显了跨模态安全对齐的紧迫需求。
引用
@article{arxiv.2603.16445,
title = {Visual Distraction Undermines Moral Reasoning in Vision-Language Models},
author = {Xinyi Yang and Chenheng Xu and Weijun Hong and Ce Mo and Qian Wang and Fang Fang and Yixin Zhu},
journal= {arXiv preprint arXiv:2603.16445},
year = {2026}
}