面向无语义污染的纯文本肖像定制:SPF-Portrait
计算机视觉与模式识别
2025-05-28 v3
摘要
针对文本到肖像定制领域,现有方法通过在量身肖像数据集上微调预训练文本到图像模型是主流做法。然而,这些方法在定制肖像属性时常严重影响原始模型的行为(例如ID、布局等变化)。为此,我们提出了SPF-Portrait,旨在纯粹理解定制目标语义并最大程度减少对原始模型的干扰。在SPF-Portrait中,我们设计了双路径对比学习管道,將原始模型作为常规微调路径的行为对齐参考。在对比学习过程中,我们提出了新颖的语义感知细粒度控制图(Semantic-Aware Fine Control Map),用于指示目标语义响应区域的强度,以空间方式引导对比路径之间的对齐。在此过程中,该机制能够在不同区域之间灵活平衡行为对齐与目标语义响应性。此外,我们提出了新颖的响应增强机制,以强化目标语义的呈现,同时缓解直接跨模态监督中固有的表示差异。在上述策略的推动下,我们实现了针对纯文本肖像定制的定制目标语义的增量学习。大量实验表明,SPF-Portrait在性能上实现了最先进的水平。项目页面: https://spf-portrait.github.io/SPF-Portrait/
引用
@article{arxiv.2504.00396,
title = {SPF-Portrait: Towards Pure Text-to-Portrait Customization with Semantic Pollution-Free Fine-Tuning},
author = {Xiaole Xian and Zhichao Liao and Qingyu Li and Wenyu Qin and Pengfei Wan and Weicheng Xie and Long Zeng and Linlin Shen and Pingfa Feng},
journal= {arXiv preprint arXiv:2504.00396},
year = {2025}
}