中文

基于生成扩散先验与指令调优的野生环境下单次人脸草稿合成

图形学 2025-06-19 v1 密码学与安全 计算机视觉与模式识别 计算机与社会

摘要

人脸草稿合成旨在将人脸照片转换为草稿。现有人脸草稿合成研究主要依赖来自现有数据集的大量照片-草稿样本对。然而, 这些大规模判别式学习方法将面临数据稀缺和高人力成本的问题。一旦训练数据稀缺, 其生成性能将显著降低。本文提出一种基于扩散模型的单次人脸草稿合成方法。我们优化面向扩散模型的文本指令, 使用人脸照片-草稿图像对进行优化。然后, 使用通过基于梯度的优化得出的指令进行推理。为更准确地模拟真实场景并更全面地评估方法效果, 我们引入一个新基准,称为单次人脸草稿数据集(OS-Sketch)。该基准包含400对人脸照片-草稿图像对, 包括不同风格的草稿和不同背景、年龄、性别、表情、照明等条件的照片。为进行可靠的离分布评估, 我们每次仅使用一对图像进行训练, 其余用于推理。大量实验表明, 所提出的方法可在单次上下文中将各种照片转换为逼真且高度一致的草稿。与其他方法相比, 本方法更加便捷且适用范围更广。该数据集将在https://github.com/HanWu3125/OS-Sketch 上提供。

关键词

引用

@article{arxiv.2506.15312,
  title  = {One-shot Face Sketch Synthesis in the Wild via Generative Diffusion Prior and Instruction Tuning},
  author = {Han Wu and Junyao Li and Kangbo Zhao and Sen Zhang and Yukai Shi and Liang Lin},
  journal= {arXiv preprint arXiv:2506.15312},
  year   = {2025}
}

备注

We propose a novel framework for face sketch synthesis, where merely a single pair of samples suffices to enable in-the-wild face sketch synthesis