中文

LIVS:面向包容性公共空间的多准则对齐数据集

计算机视觉与模式识别 2025-11-11 v2 人工智能 人机交互

摘要

我们提出Local Intersectional Visual Spaces(LIVS)数据集,这是一个用于多准则对齐的基准,经历了两年与30个社区组织的参与式过程,以支持文本到图像(T2I)模型在包容性城市规划中的多元化对齐。数据集包含37,710组两两比较,覆盖13,462张图片,沿六个准则——可访问性、安全性、舒适性、邀请性、包容性和多样性——构建,这些准则源自634个社区定义的概念。使用Direct Preference Optimization(DPO),我们微调Stable Diffusion XL以反映多准则空间偏好,并通过四个案例研究评估LIVS数据集和微调后的模型:(1)DPO在高标注量时提高了与标注偏好的对齐程度;(2)偏好模式因参与者身份而异,凸显了跨准则数据的数据需求;(3)人类编写的提示生成的视觉输出比LLM生成的更具辨识度,影响标注的决定性;(4)跨准则群体在各准则之间分配系统性不同的评分,揭示了单目标对齐的局限性。尽管DPO在特定条件下提高了对齐度,但中性评分的普遍存在表明社区价值观是异构且常常模糊的。LIVS为开发反映当地、利益相关者驱动偏好的T2I模型提供了基准,为空间设计中的情境感知对齐奠定了基础。

关键词

引用

@article{arxiv.2503.01894,
  title  = {LIVS: A Pluralistic Alignment Dataset for Inclusive Public Spaces},
  author = {Rashid Mushkani and Shravan Nayak and Hugo Berard and Allison Cohen and Shin Koseki and Hadrien Bertrand},
  journal= {arXiv preprint arXiv:2503.01894},
  year   = {2025}
}

备注

ICML 2025