中文

ChildDiffusion:利用稳定扩散模型和大语言模型释放生成式AI在儿童面部数据中的可控增强潜力

计算机视觉与模式识别 2024-10-23 v1

摘要

在这项研究工作中,我们提出了高级的ChildDiffusion框架,该框架能够生成逼真的儿童面部样本,并进一步通过短文本提示、来自大语言模型(LLM)的详细文本指导,以及利用文本引导控制条件进行图像到图像的转换,在儿童面部数据上嵌入多种智能增强,从而为构建完全合成的大规模儿童数据集提供了机会。该框架通过渲染代表种族数据、微表情、面部姿态变化、眨眼效果、面部配饰、不同发色和发型、年龄变化以及单帧中多个不同性别儿童对象的高质量儿童面部图像进行了验证。解决儿童数据采集中的隐私问题需要一种涉及法律、伦理和技术考量的综合方法。基于此,该框架可适用于合成儿童面部数据,这些数据可有效用于众多下游机器学习任务。所提出的方法规避了生成式AI工具中常见的问题,如时间不一致性和对渲染输出的有限控制。作为一个示例性用例,我们通过在生产推理阶段部署模型,开源了包含五个不同类别(非洲裔、亚裔、白种人、南亚裔/印度裔和西班牙裔)的2500个儿童面部样本的儿童种族数据。渲染后的数据经过严格的定性和定量测试以交叉验证其有效性,并进一步微调YOLO架构,用于检测和分类儿童种族,作为一项示例性的下游机器学习任务。

关键词

引用

@article{arxiv.2406.11592,
  title  = {ChildDiffusion: Unlocking the Potential of Generative AI and Controllable Augmentations for Child Facial Data using Stable Diffusion and Large Language Models},
  author = {Muhammad Ali Farooq and Wang Yao and Peter Corcoran},
  journal= {arXiv preprint arXiv:2406.11592},
  year   = {2024}
}

备注

This work has been submitted to the IEEE Transactions Journal for possible publication