中文

翻译中的失踪:文本到图像扩散模型中的潜在概念错位

人工智能 2024-08-06 v2 计算与语言

摘要

文本到图像扩散模型的进步拓展了广泛的下游实际应用,但这些模型常常遇到文本与图像之间的错位问题。以生成两个相互独立概念的组合为例,例如提示词"a tea cup of iced coke",现有模型通常会生成"a glass cup of iced coke",因为冰可乐通常与玻璃杯共现,而非茶杯。在扩散模型的潜在语义空间中存在概念混淆,这就是我们称之为潜在概念错位 (LC-Mis) 的现象。我们利用大语言模型 (LLM) 深入探讨 LC-Mis 的范围,并开发了一个用于将扩散模型的潜在语义与文本提示对齐的自动化管道。实证评估确认了我们方法的有效性,显著减少了 LC-Mis 错误,增强了文本到图像扩散模型的鲁棒性和灵活性。代码和数据集已公开:https://github.com/RossoneriZhao/iced_coke。

关键词

引用

@article{arxiv.2408.00230,
  title  = {Lost in Translation: Latent Concept Misalignment in Text-to-Image Diffusion Models},
  author = {Juntu Zhao and Junyu Deng and Yixin Ye and Chongxuan Li and Zhijie Deng and Dequan Wang},
  journal= {arXiv preprint arXiv:2408.00230},
  year   = {2024}
}

备注

Accepted by the 18th European Conference on Computer Vision ECCV 2024