MoralCLIP:基于道德基础理论对视觉-语言表示进行对比式对齐
计算机视觉与模式识别
2025-10-31 v2
摘要
最近的视觉-语言模型进展使我们能够实现跨模态的丰富语义理解。然而,这些编码方法缺乏解释或推理内容道德维度的能力——这是一个关键的人类认知方面。本文通过引入基于道德基础理论(MFT)的显式道德 grounding 来弥补这一差距,提出 MoralCLIP,一种扩展多模态学习的新型嵌入表示方法。我们的 метод 将视觉和文本道德线索整合到统一的嵌入空间中,实现跨模态道德对齐。MoralCLIP 基于 Social-Moral Image Database 这一多标签数据集来识别视觉内容中共现的道德基础。在 MoralCLIP 训练方面,我们设计了一种道德数据增强策略,将标注数据集扩展到 15,000 条带有 MFT 对齐维度的图像-文本对。我们的结果表明,显式道德监督能够提升单模态和多模态道德内容理解,为具备道德价值观感知与对齐能力的人类智能系统奠定了基础。
引用
@article{arxiv.2506.05696,
title = {MoralCLIP: Contrastive Alignment of Vision-and-Language Representations with Moral Foundations Theory},
author = {Ana Carolina Condez and Diogo Tavares and João Magalhães},
journal= {arXiv preprint arXiv:2506.05696},
year = {2025}
}
备注
Updated version: corresponds to the ACM MM '25 published paper and includes full appendix material