中文

《ITI-GEN:包容性文本到图像生成》可复现性研究

计算机视觉与模式识别 2024-07-30 v1 人工智能

摘要

文本到图像生成模型在某些敏感属性(如性别或肤色)方面常存在公平性问题。本研究旨在复现 Zhang 等人(2023a)在《ITI-GEN:包容性文本到图像生成》中提出的模型,该模型旨在提高此类模型的包容性。我们表明,关于 ITI-GEN 的大部分论点都得到了验证:它改善了生成图像的多样性和质量,能够扩展到不同领域,具备即插即用特性,且在计算效率方面表现优异。然而,ITI-GEN 有时会将不希望出现的属性作为代理特征使用,且无法分离某些(相关)属性对,例如性别和脱发。此外,当考虑的属性数量增加时,训练时间呈指数增长,ITI-GEN 在处理分布中所有元素的包容性图像生成方面受限。为解决这些问题,我们提出使用带负面提示的硬提示搜索方法,这种方法无需训练,能够比普通硬提示搜索更好地处理否定问题。尽管如此,硬提示搜索(无论是否带负面提示)无法用于那些难以用自然语言表达的连续属性,而 ITI-GEN 在这方面表现突出,因为其训练时受图像指导。最后,我们提出将 ITI-GEN 与带负面提示的硬提示搜索相结合。

关键词

引用

@article{arxiv.2407.19996,
  title  = {Reproducibility Study of "ITI-GEN: Inclusive Text-to-Image Generation"},
  author = {Daniel Gallo Fernández and Răzvan-Andrei Matisan and Alejandro Monroy Muñoz and Janusz Partyka},
  journal= {arXiv preprint arXiv:2407.19996},
  year   = {2024}
}

备注

Accepted to TMLR, see https://openreview.net/forum?id=d3Vj360Wi2