多模态文化安全:评估框架与对齐策略
计算与语言
2025-12-23 v2
摘要
大型视觉语言模型(LVLM)正在全球分布式应用中得到部署,例如旅游助手,但其生产文化合适响应的能力仍未得到充分探索。现有多模态安全基准主要关注物理安全,忽略根植于文化规范的违规行为,这些违规行为可能导致象征性伤害。为此,我们引入CROSS,一个旨在评估LVLM文化安全推理能力的基准。CROSS包括来自16个国家的1,284个多语言视觉锚定查询,涵盖三个日常领域和14种语言,其中文化规范违规仅在图像在上下文中被解释时才会出现。我们提出了CROSS-Eval,一个基于跨文化理论的框架,用于衡量四个关键维度:文化意识、规范教育、遵从性和有用性。在此框架下,我们评估了21个领先的LVLM,包括 mixture-of-experts 模型和推理模型。结果显示出显著的文化安全差距:最佳表现模型在意识方面仅达到61.79%,在遵从方面仅达到37.73%。虽然一些开源模型达到了GPT-4o水平,但仍显著不足于专有模型。我们的进一步研究表明,增加推理容量有助于改善文化对齐,但并未完全解决此问题。为提高模型性能,我们开发了两种增强策略:使用以文化为基础的开放式数据进行监督式微调,以及使用突显安全与不安全行为的对比响应对进行偏好调优。这两种方法显著提高了GPT-4o的文化意识(+60.14%)和遵从(+55.2%),同时在一般多模态理解基准上几乎没有性能下降。
引用
@article{arxiv.2505.14972,
title = {Multimodal Cultural Safety: Evaluation Framework and Alignment Strategies},
author = {Haoyi Qiu and Kung-Hsiang Huang and Ruichen Zheng and Jiao Sun and Nanyun Peng},
journal= {arXiv preprint arXiv:2505.14972},
year = {2025}
}