AIComposer:通过特征集成实现任意风格和内容图像构图
计算机视觉与模式识别
2025-07-29 v1
摘要
图像构图技术近年来得以显著进步,得益于大规模预训练的文本到图像扩散模型。尽管在同领域构图方面取得了进展,但跨领域构图仍鲜有探索。主要挑战在于扩散模型的随机性以及输入图像之间的风格差距,导致构图失败和产生伪影。此外,高度依赖文本提示限制了实际应用。本文提出了首个无需文本提示的跨领域图像构图方法,实现自然的风格化和无缝构图。该方法高效且稳健,因其涉及反向反转和正向去噪的少量步骤,无需对扩散模型进行训练。该方法还使用简单的多层感知器网络集成来自前景和背景的 CLIP 特征,通过局部交叉注意力策略进行扩散操控。它有效地保留前景内容,同时实现稳定的风格化,而无需预风格化网络。最后,我们创建了一个包含多样内容和风格的基准数据集,以进行公平评估,弥补跨领域图像构图缺乏测试数据集的不足。我们的方法在定性和定量评估中均优于最新技术,显著提高了 LPIPS 分数 30.5% 和 CSD 指标 18.1%。我们相信本方法将推动未来研究和应用的发展。代码和基准数据集请访问 https://github.com/sherlhw/AIComposer。
引用
@article{arxiv.2507.20721,
title = {AIComposer: Any Style and Content Image Composition via Feature Integration},
author = {Haowen Li and Zhenfeng Fan and Zhang Wen and Zhengzhou Zhu and Yunjin Li},
journal= {arXiv preprint arXiv:2507.20721},
year = {2025}
}