中文

视觉语言模型是否拥有道德支柱?关于视觉语言模型脆弱道德性的研究

计算机与社会 2026-01-27 v1 人工智能 计算与语言 计算机视觉与模式识别 机器学习

摘要

尽管致力于改进视觉语言模型(VLM)的道德对齐方面已有大量工作,但是否在真实场景中其伦理判断保持稳定性仍不明确。本文研究了视觉语言模型中的道德鲁棒性,即在不改变 underlying moral context 的情况下,维持道德判断能力。我们系统性地对VLMs施加多样化的模型无关性多模态扰动,发现其道德立场在简单操作下经常翻转。我们的分析揭示了在扰动类型、道德领域和模型规模方面的系统性脆弱性,包括一种从众性 trade-off,即更强的指令遵循模型更容易受到说服。我们进一步表明,轻量级的推理时干预可部分恢复道德稳定性。这些结果表明,道德对齐本身不足,道德鲁棒性是VLMs负责任部署的必要条件。

关键词

引用

@article{arxiv.2601.17082,
  title  = {Do VLMs Have a Moral Backbone? A Study on the Fragile Morality of Vision-Language Models},
  author = {Zhining Liu and Tianyi Wang and Xiao Lin and Penghao Ouyang and Gaotang Li and Ze Yang and Hui Liu and Sumit Keswani and Vishwa Pardeshi and Huijun Zhao and Wei Fan and Hanghang Tong},
  journal= {arXiv preprint arXiv:2601.17082},
  year   = {2026}
}