中文

利用上下文化Vendi分数引导提升生成图像的地理多样性

计算机视觉与模式识别 2024-08-05 v2 人工智能 机器学习

摘要

随着文本到图像生成模型的日益普及,人们越来越关注理解其风险和偏见。最近的研究发现,最先进的模型难以以真实世界的多样性描绘日常物体,并且在地理区域之间存在显著差距。在这项工作中,我们旨在增加常见物体生成图像的多样性,使得每个区域的变体能够代表真实世界。我们引入了一种推理时干预方法——上下文化Vendi分数引导(c-VSG),它引导潜在扩散模型的反向步骤,以增加样本与先前生成图像的“记忆库”相比的多样性,同时将变化量限制在一组真实世界上下文图像示例集内。我们使用两个具有地理代表性的数据集评估c-VSG,发现它显著增加了生成图像的多样性,无论是对于表现最差的区域还是平均而言,同时保持或提高了图像质量和一致性。此外,定性分析表明,生成图像的多样性显著提高,包括原始模型中存在的简化区域描绘。我们希望这项工作朝着能够反映世界真实地理多样性的文本到图像生成模型迈出一步。

关键词

引用

@article{arxiv.2406.04551,
  title  = {Improving Geo-diversity of Generated Images with Contextualized Vendi Score Guidance},
  author = {Reyhane Askari Hemmat and Melissa Hall and Alicia Sun and Candace Ross and Michal Drozdzal and Adriana Romero-Soriano},
  journal= {arXiv preprint arXiv:2406.04551},
  year   = {2024}
}