中文

MORALISE:面向道德对齐的结构化基准

计算机视觉与模式识别 2025-05-22 v1 人工智能 计算与语言 计算机与社会 多媒体

摘要

警告:本文包含有害语言和图像的示例。建议读者自行判断。近期,视觉语言模型因其强大的多模态推理能力,在自主驾驶和医学分析等道德敏感领域展现出日益重要的影响力。随着这些模型在高风险真实世界应用中的部署,确保其输出与人类道德价值观相吻合并始终处于道德边界之内变得至关重要。然而,现有工作要么仅关注文本模态,要么依赖大量AI生成的图像,导致分布偏差并降低现实性。为克服这些限制,我们引入MORALISE——一个使用多样化、经专家验证的真实世界数据,用于评估视觉语言模型道德对齐的全面基准。我们提出了基于Turiel领域理论的13个道德主题的全面分类体系,涵盖个人、人际和社会道德领域。基于此框架,我们手动筛选了2,481个高质量的图像-文本对,每个样本标注两个细粒度标签:(1) 主题标注,标识违反的道德主题;(2) 模态标注,指示违规来源是图像还是文本。对于评估,我们包含两个任务,即"道德判断"和"道德规范归属",以衡量模型对道德违规的认知以及其在道德敏感内容上的推理能力。对19个主流开源和闭源视觉语言模型进行大规模实验表明,MORALISE是一个重大挑战,揭示了当前最先进模型中持续的道德局限。该完整基准已公开发布于https://huggingface.co/datasets/Ze1025/MORALISE。

关键词

引用

@article{arxiv.2505.14728,
  title  = {MORALISE: A Structured Benchmark for Moral Alignment in Visual Language Models},
  author = {Xiao Lin and Zhining Liu and Ze Yang and Gaotang Li and Ruizhong Qiu and Shuke Wang and Hui Liu and Haotian Li and Sumit Keswani and Vishwa Pardeshi and Huijun Zhao and Wei Fan and Hanghang Tong},
  journal= {arXiv preprint arXiv:2505.14728},
  year   = {2025}
}

备注

21 pages, 11 figures, 7 tables