MagiCapture:高分辨率多概念人像定制
计算机视觉与模式识别
2024-02-05 v2 图形学
机器学习
摘要
包括 Stable Diffusion 在内的大规模文本到图像模型能够生成高保真写实人像图像。有一活跃研究领域致力于个性化这些模型,旨在利用提供的参考图像集合成特定主体或风格。然而,尽管这些个性化方法结果看似合理,其生成图像往往缺乏真实感,尚未达到商业可行水平。这在人像图像生成中尤为明显,由于人类固有的偏见,人脸中任何不自然伪影都易被察觉。为此,我们提出 MagiCapture,一种将主体与风格概念融合、仅用少量主体与风格参考即可生成高分辨率人像图像的个性化方法。例如,给定少量随机自拍,我们微调的模型可生成特定风格(如证件照或简历照)的高质量人像。该任务的主要挑战在于组合概念缺乏真值,导致最终输出质量下降与源主体身份偏移。为解决这些问题,我们提出一种新颖的注意力重聚焦损失(Attention Refocusing loss)辅以辅助先验,二者均有助于该弱监督学习设定下的稳健学习。我们的流程还包含额外后处理步骤以确保高度真实输出。MagiCapture 在定量与定性评估中均优于其他基线,并可泛化至其他非人类物体。
引用
@article{arxiv.2309.06895,
title = {MagiCapture: High-Resolution Multi-Concept Portrait Customization},
author = {Junha Hyung and Jaeyo Shin and Jaegul Choo},
journal= {arXiv preprint arXiv:2309.06895},
year = {2024}
}
备注
18 pages, 17 figures