中文

跨注意力头位置模式可与文本到图像生成模型中的人类视觉概念对齐

计算机视觉与模式识别 2025-02-25 v3 人工智能

摘要

最近的文本到图像扩散模型利用交叉注意力层,已有效用于提升各种视觉生成任务。然而,我们对交叉注意力层的理解仍相对有限。本研究引入一种机制可解释性方法,通过构建 Head Relevance Vectors (HRV) 来对齐人类指定的视觉概念。对于给定视觉概念的 HRV,其长度为交叉注意力头的总数,每个元素代表该头对该视觉概念的重要性。为验证 HRV 作为可解释特征,我们开发了有序削弱分析,证明其有效性。此外,我们提出概念强化和概念调整方法,并应用于增强三个视觉生成任务。我们的结果表明,HRV 可减少图像生成中多义词的误解释,成功修改图像编辑中五个具有挑战性的属性,并缓解多概念生成中的灾难性遗忘。总体而言,本工作在理解交叉注意力层方面取得进展,并为在头级别对这些层进行精细控制提供新方法。

关键词

引用

@article{arxiv.2412.02237,
  title  = {Cross-Attention Head Position Patterns Can Align with Human Visual Concepts in Text-to-Image Generative Models},
  author = {Jungwon Park and Jungmin Ko and Dongnam Byun and Jangwon Suh and Wonjong Rhee},
  journal= {arXiv preprint arXiv:2412.02237},
  year   = {2025}
}

备注

Accepted by ICLR 2025