I2AM: 通过双向归因图解释图像到图像潜在扩散模型
计算机视觉与模式识别
2025-03-21 v2 人工智能
摘要
大规模扩散模型通过跨注意力机制在图像生成方面取得了显著进展。尽管跨注意力在文本到图像任务中已被广泛研究,但其在图像到图像(I2I)扩散模型中的可解释性仍鲜有探索。本文引入图像到图像归因图(I2AM),通过可视化双向归因图(从参考图像到生成图像以及反之)来增强I2I模型的可解释性。I2AM聚合跨注意力得分,涵盖时间步、注意力头和层,提供关于关键特征在图像之间传递的见解。我们在目标检测、图像修复和超分辨率任务中展示了I2AM的有效性。结果表明,I2AM成功识别了生成输出所需的关键区域,即使在复杂场景中亦如此。此外,我们引入了修复掩码注意力一致性得分(IMACS)作为一种新型评估指标,以衡量归因图与修复掩码之间的对齐程度,该指标与现有性能指标高度相关。通过大量实验,我们表明I2AM使模型调试和优化成为可能,为改进I2I模型性能和可解释性提供了实用工具。
引用
@article{arxiv.2407.12331,
title = {I2AM: Interpreting Image-to-Image Latent Diffusion Models via Bi-Attribution Maps},
author = {Junseo Park and Hyeryung Jang},
journal= {arXiv preprint arXiv:2407.12331},
year = {2025}
}
备注
23 pages