中文

UniF$^2$ace:统一的细粒度人脸理解与生成模型

计算机视觉与模式识别 2026-01-14 v5 人工智能 机器学习 多媒体

摘要

统一多模态模型(UMMs)已成为基础跨模态研究中的一种强大范式,在图像理解与生成两方面均展现出巨大潜力。然而,人脸领域现有的研究主要面临两个挑战:(1)\textbf{(1)} 碎片化发展\textbf{碎片化发展},现有方法未能将理解与生成统一于单一模型中,阻碍了通向通用人工智能的道路。(2) 缺乏细粒度人脸属性\textbf{(2) 缺乏细粒度人脸属性},而这对于高保真应用至关重要。为解决这些问题,我们提出 \textbf{UniF^2ace}首个专为细粒度人脸理解与生成定制的 UMM\textit{首个专为细粒度人脸理解与生成定制的 UMM}首先\textbf{首先},我们引入了一个具有双重离散扩散(D3Diff)损失的新型理论框架,将掩码生成模型与离散分数匹配扩散相统一,从而对负对数似然给出更精确的逼近。此外,D3Diff 显著增强了模型合成与文本输入对齐的高保真面部细节的能力。其次\textbf{其次},我们提出一种多层级分组混合专家架构,自适应地结合语义与身份面部嵌入,以弥补表征演化过程中的属性遗忘现象。最后\textbf{最后},为此我们构建了 UniF2^2aceD-1M,一个包含 13 万对细粒度图像-标题对和 100 万个视觉问答对的大规模数据集,涵盖的面部属性范围远超现有数据集。大量实验表明,UniF2^2ace 在理解和生成任务中均优于同等规模的现有模型,其 Desc-GPT 与 VQA-score 分别高出 7.1% 和 6.6%。

关键词

引用

@article{arxiv.2503.08120,
  title  = {UniF$^2$ace: A Unified Fine-grained Face Understanding and Generation Model},
  author = {Junzhe Li and Sifan Zhou and Liya Guo and Xuerui Qiu and Linrui Xu and Delin Qu and Tingting Long and Chun Fan and Ming Li and Hehe Fan and Jun Liu and Shuicheng Yan},
  journal= {arXiv preprint arXiv:2503.08120},
  year   = {2026}
}