FreeMorph:无调参的通用图像形状混合方法
计算机视觉与模式识别
2025-07-03 v1
摘要
我们提出了 FreeMorph,这是首个无需调参即可实现不同语义或布局输入图像形状混合的方法。与依赖在预训练扩散模型上进行微调且受限于时间和语义/布局差异的现有方法不同,FreeMorph 无需逐实例训练即可实现高保真图像形状混合。尽管调参方法在效率和潜力方面表现出色,但由于多步去噪过程的非线性特性以及来自预训练扩散模型的偏差,仍面临保持高质量结果的挑战。本文通过引入两个关键创新来解决这些挑战:1) 我们首次提出了螺旋插值设计,结合显式引导,通过修改自注意力模块来整合输入图像的引导,从而解决身份丢失问题,确保生成序列中的方向性转换。2) 我们进一步引入了面向步骤的变化趋势,通过融合来自每个输入图像的自注意力模块,以实现受两者约束且一致的转换。我们的广泛评估表明,FreeMorph 在现有方法中取得优异性能,速度提升 10 倍~50 倍,为图像形状混合树立了新的国际前沿。
引用
@article{arxiv.2507.01953,
title = {FreeMorph: Tuning-Free Generalized Image Morphing with Diffusion Model},
author = {Yukang Cao and Chenyang Si and Jinghao Wang and Ziwei Liu},
journal= {arXiv preprint arXiv:2507.01953},
year = {2025}
}
备注
ICCV 2025. Project page: https://yukangcao.github.io/FreeMorph/