中文

谁的安全观?面向文本到图像模型的多元对齐DIVE数据集

机器学习 2025-07-21 v1 人工智能 计算机视觉与模式识别

摘要

当前文本到图像(T2I)模型常常未能充分考虑多样化的人类体验,导致系统与人类价值观对齐不足。我们倡导多元对齐(pluralistic alignment),即AI系统能够理解并可被引导 towards 多元且常常相互冲突的人类价值观。本工作为实现此目标提供三大核心贡献:其一,我们引入一种新型数据集,用于多样化交叉性视觉评估(DIVE)——首个面向多元对齐的多模态数据集。它通过大规模人口统计学交叉性人类评审者提供的广泛反馈,覆盖1000个提示,具备高复制性,捕捉细致的安全感知。其二,我们实证性地确认人口统计学特征是本领域多元观点的关键代理变量,揭示了在不同情境下关于伤害感知的显著差异,这些差异超越常规评估的范畴。其三,我们讨论了构建对齐T2I模型的实际意义,包括高效数据收集策略、LLM判断能力以及如何引导模型朝向多元视角。该研究为构建更公平、更对齐的T2I系统提供了基础性工具。内容警告:本论文包含可能对人类有害的敏感内容。

关键词

引用

@article{arxiv.2507.13383,
  title  = {Whose View of Safety? A Deep DIVE Dataset for Pluralistic Alignment of Text-to-Image Models},
  author = {Charvi Rastogi and Tian Huey Teh and Pushkar Mishra and Roma Patel and Ding Wang and Mark Díaz and Alicia Parrish and Aida Mostafazadeh Davani and Zoe Ashwood and Michela Paganini and Vinodkumar Prabhakaran and Verena Rieser and Lora Aroyo},
  journal= {arXiv preprint arXiv:2507.13383},
  year   = {2025}
}

备注

28 pages, 16 figures