中文

DiFace:基于受控扩散的跨模态人脸识别

计算机视觉与模式识别 2023-12-05 v1 人工智能

摘要

扩散概率模型 (DPMs) 在生成高质量和高真实感的视觉媒体方面展现出了卓越的能力。然而,它们在非生成领域(如人脸识别)的潜力尚未得到深入研究。同时,尽管多模态人脸识别方法得到了广泛发展,但其重点主要集中在视觉模态。在此背景下,通过文本描述进行人脸识别提供了一种独特且有前景的解决方案,它不仅超越了应用场景的局限性,还拓展了跨模态人脸识别领域的研究潜力。遗憾的是,由于主要与三个方面相关的挑战,这一途径仍未被探索和充分利用:1) 语言描述的内在不精确性;2) 文本与图像之间的显著差距;3) 数据库不足带来的巨大障碍。为解决这一问题,我们提出了 DiFace,该解决方案通过建立其与概率传输的理论联系,利用受控扩散过程有效地实现了基于文本的人脸识别。我们的方法不仅释放了 DPMs 在更广泛任务中的潜力,而且据我们所知,首次在文本到图像的人脸识别中实现了显著的准确率,这在验证和识别实验中得到了证明。

关键词

引用

@article{arxiv.2312.01367,
  title  = {DiFace: Cross-Modal Face Recognition through Controlled Diffusion},
  author = {Bowen Sun and Shibao Zheng},
  journal= {arXiv preprint arXiv:2312.01367},
  year   = {2023}
}