文本到图像生成模型能准确描绘年龄吗?关于合成肖像生成与年龄估计的比较研究
计算机视觉与模式识别
2025-02-06 v1
摘要
文本到图像生成模型在生成多样且逼真的输出方面取得了显著进展。本文提供了全面分析其在创建准确代表各种人口统计属性的合成肖像方面的效果,特别关注年龄、国籍和性别。我们的评估采用指定详细轮廓(如 "Photorealistic selfie photo of a 32-year-old Canadian male")的提示,覆盖 212 个国籍、30 个不同年龄(10 岁至 78 岁)以及平衡的性别表示。我们将生成的图像与来自两个 established age 估计模型的 ground truth 年龄估计进行比较,以评估年龄描绘的忠实度。我们的发现表明,尽管文本到图像模型可以持续生成反映不同身份的面部图像,但它们捕捉特定年龄的准确性以及在不同人口统计背景下实现年龄的能力仍高度可变。这些结果表明,除非愿意投入大量筛选和策展工作,否则当前的合成数据可能不足以可靠地用于需要稳健精度的高风险年龄相关任务。尽管如此,它们仍可能在不敏感或探索性应用中有用,除非绝对年龄精度不是关键要求。
引用
@article{arxiv.2502.03420,
title = {Can Text-to-Image Generative Models Accurately Depict Age? A Comparative Study on Synthetic Portrait Generation and Age Estimation},
author = {Alexey A. Novikov and Miroslav Vranka and François David and Artem Voronin},
journal= {arXiv preprint arXiv:2502.03420},
year = {2025}
}