HeadRouter:基于自适应路由注意力头的无训练图像编辑框架
计算机视觉与模式识别
2024-11-25 v1 机器学习
摘要
扩散变换器(DiT)在图像生成任务中展现出强大的能力。然而,针对多模态DiT(MM-DiT)的精确文本导向图像编辑仍面临重大挑战。不同于采用自注意力/交叉注意力图实现语义编辑的UNet结构,MM-DiT缺乏对显式且一致文本引导的支持,导致编辑结果与文本之间存在语义错位。本研究揭示了不同注意力头对MM-DiT中不同图像语义的敏感性,提出HeadRouter——一种无训练图像编辑框架,通过自适应将文本引导路由到MM-DiT的不同注意力头中进行编辑。此外,我们引入双token精炼模块,用于精细化文本/图像token表示,以实现精准的语义指引和准确的区域表达。实验结果表明,HeadRouter在多个基准测试中在编辑保真度和图像质量方面均表现出佳绩。
引用
@article{arxiv.2411.15034,
title = {HeadRouter: A Training-free Image Editing Framework for MM-DiTs by Adaptively Routing Attention Heads},
author = {Yu Xu and Fan Tang and Juan Cao and Yuxin Zhang and Xiaoyu Kong and Jintao Li and Oliver Deussen and Tong-Yee Lee},
journal= {arXiv preprint arXiv:2411.15034},
year = {2024}
}