基于标量判断与列表对齐的 grounding 多模态道德推理
计算机视觉与模式识别
2026-02-04 v1 人机交互
摘要
视觉语言模型 (VLM) 仍在多模态和社会模糊情境中难以作出道德相关判断。先前的工作通常依赖二元或两两监督,往往无法捕捉人类道德推理的连续性和多样性。我们提出 MM-SCALE (Multimodal Moral Scale),一个大规模数据集,通过 5 分量评分和显式模态 grounding 将 VLM 对齐人类道德偏好。每张图像情景对都由人类标注道德可接受度评分和 grounding 推理标签,使用我们为数据收集量身定制的界面,实现对排序情景集合的列表级偏好优化。通过从离散监督转向标量监督,我们的框架提供更丰富的对齐信号和更精细的多模态道德推理校准。实验表明, 在 MM-SCALE 上微调的 VLM 在排序保真度和更稳定的安全校准方面优于使用二元信号训练的 VLM。
引用
@article{arxiv.2602.03665,
title = {MM-SCALE: Grounded Multimodal Moral Reasoning via Scalar Judgment and Listwise Alignment},
author = {Eunkyu Park and Wesley Hanwen Deng and Cheyon Jin and Matheus Kunzler Maldaner and Jordan Wheeler and Jason I. Hong and Hong Shen and Adam Perer and Ken Holstein and Motahhare Eslami and Gunhee Kim},
journal= {arXiv preprint arXiv:2602.03665},
year = {2026}
}