中文

A-STAR:用于文本到图像合成的测试时注意力隔离与保持

计算机视觉与模式识别 2023-06-27 v1

摘要

尽管文本到图像生成模型的最新进展带来了一系列能够从自由形式文本生成创造性图像的高性能方法,但仍存在若干局限。通过分析这些模型的跨注意力表示,我们注意到两个关键问题。首先,对于包含多个概念的文本提示,不同概念对之间存在显著的像素空间重叠(即相同空间区域)。这最终导致模型无法区分两个概念,其中之一在最终生成中被忽略。其次,尽管这些模型在去噪初期(如前几步)试图捕获所有此类概念(如跨注意力图所示),但该知识在去噪结束时(如最后几步)未被保留。这种知识丢失最终导致生成输出不准确。为解决这些问题,我们的关键创新包括两个测试时基于注意力的损失函数,可大幅改进预训练基线文本到图像扩散模型的性能。首先,我们的注意力隔离损失减少了文本提示中不同概念的注意力图之间的跨注意力重叠,从而减少各概念间的混淆/冲突,并在生成输出中最终捕获所有概念。其次,我们的注意力保持损失显式迫使文本到图像扩散模型在所有去噪时间步上保留所有概念的跨注意力信息,从而减少信息丢失并在生成输出中保留所有概念。

关键词

引用

@article{arxiv.2306.14544,
  title  = {A-STAR: Test-time Attention Segregation and Retention for Text-to-image Synthesis},
  author = {Aishwarya Agarwal and Srikrishna Karanam and K J Joseph and Apoorv Saxena and Koustava Goswami and Balaji Vasan Srinivasan},
  journal= {arXiv preprint arXiv:2306.14544},
  year   = {2023}
}

备注

15 pages, 16 figures