中文

嵌入伦理意识:通过轻量级价值优化实现文本到图像合成对齐

计算机视觉与模式识别 2024-10-17 v1 人工智能 计算机与社会 机器学习 多媒体

摘要

近期大规模数据训练的扩散模型进展,使得能够生成与人类水平难以区分的图像,但常常会产生与人类价值观不一致的有害内容,如社会偏见和冒犯性内容。尽管对大型语言模型(LLM)的对齐研究已广泛展开,但文本到图像(T2I)模型的对齐挑战仍鲜有探索。为此,我们提出了 LiVO(Lightweight Value Optimization),一种新颖的轻量级方法,用于将 T2I 模型与人类价值观对齐。LiVO仅优化一个即插即用的值编码器,将指定的价值原则与输入提示整合,从而控制生成图像在语义和价值方面的表现。具体而言,我们设计了一种针对扩散模型的偏好优化损失,该理论上近似于 LLM 对齐中使用的布拉德利-蒂里模型,但提供了更灵活的图像质量与价值一致性之间的权衡。为优化值编码器,我们还开发了一个自动构建包含 86k 条(提示、对齐图像、违反图像、价值原则)样本的文本-图像偏好数据集。该方法无需更新大多数模型参数,即可通过从输入提示中进行自适应价值选择,显著降低有害输出,同时实现更快的收敛,超越多个强大基线,为伦理对齐的 T2I 模型铺平了初步道路。

关键词

引用

@article{arxiv.2410.12700,
  title  = {Embedding an Ethical Mind: Aligning Text-to-Image Synthesis via Lightweight Value Optimization},
  author = {Xingqi Wang and Xiaoyuan Yi and Xing Xie and Jia Jia},
  journal= {arXiv preprint arXiv:2410.12700},
  year   = {2024}
}

备注

Accepted by ACM Multimedia 2024. The dataset and code can be found at https://github.com/achernarwang/LiVO