锚定标记匹配:面向无训练AR图像编辑的隐式结构锁定
计算机视觉与模式识别
2025-08-12 v2
摘要
文本到图像生成因扩散模型而取得突破性进展,使其能够实现高保真合成和通过交叉注意力操作实现精确图像编辑。最近,自回归(AR)模型重新流行,凭借下一令牌生成能力不断追赶扩散模型。然而,现有针对扩散模型的编辑技术难以直接应用于AR模型,因为结构控制存在根本差异。具体而言,AR模型在图像编辑中 suffer from attention 图图的空间贫乏以及结构误差的顺序累积,这会破坏物体布局和全局一致性。本文介绍了隐式结构锁定(ISLock)——首个针对AR视觉模型的无训练编辑策略。它不依赖显式注意力操控或微调,而是通过锚定标记匹配(Anchor Token Matching, ATM)协议,动态对齐自注意力模式与参考图像,从而保留结构蓝图。通过在潜在空间中隐式强制结构一致性,我们的方法ISLock实现了结构感知编辑,同时保持生成自主性。大量实验表明,ISLock在无需额外训练的情况下实现了高质量且结构一致的编辑,性能优于或相当于传统编辑技术。我们的发现为高效灵活的AR-based图像编辑开辟了道路,进一步缩小了扩散与自回归生成模型之间的性能差距。代码将在https://github.com/hutaiHang/ATM 上公开。
引用
@article{arxiv.2504.10434,
title = {Anchor Token Matching: Implicit Structure Locking for Training-free AR Image Editing},
author = {Taihang Hu and Linxuan Li and Kai Wang and Yaxing Wang and Jian Yang and Ming-Ming Cheng},
journal= {arXiv preprint arXiv:2504.10434},
year = {2025}
}
备注
Accepted by ICCV2025. Code will be released in https://github.com/hutaiHang/ATM