帕累托增强的人像生成:面向对齐、真实性与审美的视觉对齐文本监督
计算机视觉与模式识别
2026-05-21 v1 人工智能
摘要
文本到图像扩散模型在人像生成中常面临严重的三难问题:文本-图像对齐、照片 realism 和人类感知审美天然地相互制约。监督微调(SFT)是增强图像生成真实性的有效方法,但容易过拟合训练数据集,破坏预训练图像先验,并降低对齐度或审美。为突破这一瓶颈,我们提出了一种面向多模态扩散转换器(MM-DiT)的特征监督范式。具体而言,我们引入一种轻量级的跨模态对齐机制,隐式地从 SigLIP 2 中提取多粒度视觉对齐文本表示,并在训练阶段将其应用于 MM-DiT 的图像分支,实现零额外推理开销。我们的方法在保持基础模型原始泛化性的同时注入视觉对齐文本指导,避免了 SFT 引起的性能下降。此外,我们的方法直接从预训练视觉基础模型中挖掘隐式的多粒度审美信号,以优化人类感知的审美。大量实验表明,我们的方法将帕累托前沿推向更前沿,在文本-图像对齐、照片 realism 和人类感知审美方面实现协同性提升。
引用
@article{arxiv.2605.20640,
title = {Pareto-Enhanced Portrait Generation: Vision-Aligned Text Supervision for Alignment, Realism, and Aesthetics},
author = {Yunlong Wang and Jinjin Shi and Wenbin Gao and Xuran Xu and Runyu Shi and Ying Huang},
journal= {arXiv preprint arXiv:2605.20640},
year = {2026}
}