中文

用于训练自由扩散编辑的自注意力分解

计算机视觉与模式识别 2026-02-13 v2

摘要

扩散模型在图像合成方面取得了显著的效果,但要实现对其输出进行精确控制以实现特定编辑仍具有挑战性。实现可控性的一个关键步骤是识别模型潜在表示中对应语义属性的可解释方向。现有寻找可解释方向的方法通常依赖于大规模图像采样或训练辅助网络,这限制了效率。我们提出了一种分析方法,直接从预训练扩散模型的参数中推导出语义编辑方向,无需额外数据或微调。我们的洞见是,自注意力权重矩阵在训练期间编码了关于数据分布的丰富结构信息。通过计算这些权重矩阵的特征向量,我们获得了稳健且可解释的编辑方向。实验表明,本方法在多个数据集上 produces 高质量编辑,同时通过减少 60% 的编辑时间显著提升了效率。

关键词

引用

@article{arxiv.2510.22650,
  title  = {Self-Attention Decomposition For Training Free Diffusion Editing},
  author = {Tharun Anand and Mohammad Hassan Vali and Arno Solin and Green Rosh and BH Pawan Prasad},
  journal= {arXiv preprint arXiv:2510.22650},
  year   = {2026}
}

备注

ICASSP 2026 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP)