FaR:通过概念融合和局部细化提升多概念文本到图像扩散模型
计算机视觉与模式识别
2025-04-07 v1
摘要
生成多个新概念是文本到图像任务中的一个具有挑战性的问题。当前方法往往在样本数量有限的情况下过拟合,难以处理属性泄漏,尤其是对于类别相似的主体(例如两种特定的狗)。本文引入了 Fuse-and-Refine (FaR) 方法,通过概念融合技术和局部细化损失函数来解决这些挑战。概念融合通过将参考主体与背景分离并重新组合成混合图像来系统性地增强训练数据的多样性。这种数据增强技术通过缓解有限训练样本的狭窄分布,从而解决过拟合问题。此外,引入局部细化损失函数,通过将每个概念的注意力图与其正确区域对齐来保存主体代表性属性。该方法有效地防止了属性泄漏,确保扩散模型在去噪过程中区分相似主体而不混合其注意力图。通过同时对特定模块进行微调,FaR 在平衡新概念的学习与以前已知知识的保留方面取得良好平衡。实证结果表明,FaR 不仅能够防止过拟合和属性泄漏,同时保持照片 realism,而且在其他最先进的方法中取得了优异性能。
引用
@article{arxiv.2504.03292,
title = {FaR: Enhancing Multi-Concept Text-to-Image Diffusion via Concept Fusion and Localized Refinement},
author = {Gia-Nghia Tran and Quang-Huy Che and Trong-Tai Dam Vu and Bich-Nga Pham and Vinh-Tiep Nguyen and Trung-Nghia Le and Minh-Triet Tran},
journal= {arXiv preprint arXiv:2504.03292},
year = {2025}
}