在文本到图像合成中利用同形字 exploiting 文化偏见
计算机视觉与模式识别
2024-01-10 v3 人工智能
计算机与社会
机器学习
摘要
用于文本到图像合成的模型,如DALL-E~2和Stable Diffusion,最近引起了学术界和公众的广泛关注。这些模型在以文本描述为条件时,能够生成描绘各种概念和风格的高质量图像。然而,这些模型从其海量训练数据中采纳了与特定Unicode文字相关联的文化特征,这可能不会立即显现。我们表明,只需在文本描述中插入单个非拉丁字符,常见模型就会在其生成的图像中反映文化刻板印象和偏见。我们从定性和定量两方面分析了这一行为,并确定模型的文本编码器是该现象的根本原因。此外,恶意用户或服务提供商可能试图通过用非拉丁文字中外观相似的字符(即所谓同形字)替换拉丁字符,来故意偏置图像生成以制造种族主义刻板印象。为缓解此类未被察觉的文字攻击,我们提出了一种新颖的同形字遗忘方法对文本编码器进行微调,使其对同形字操纵具有鲁棒性。
引用
@article{arxiv.2209.08891,
title = {Exploiting Cultural Biases via Homoglyphs in Text-to-Image Synthesis},
author = {Lukas Struppek and Dominik Hintersdorf and Felix Friedrich and Manuel Brack and Patrick Schramowski and Kristian Kersting},
journal= {arXiv preprint arXiv:2209.08891},
year = {2024}
}
备注
Published in the Journal of Artificial Intelligence Research (JAIR)