F-Bench:重新思考人脸生成、定制与恢复的人类偏好评估指标
计算机视觉与模式识别
2025-09-11 v2
摘要
人工智能生成模型在内容创作方面展现出卓越的能力,特别是在人脸图像生成、定制和恢复方面。然而,由于独特的失真、不真实的细节和意外的身份偏移,当前的 AI 生成人脸(AIGFs)往往无法满足人类偏好,这凸显了对 AIGFs 建立全面质量评估框架的需求。为了满足这一需求,我们引入了 FaceQ,一个包含反映人类偏好的细粒度质量标注的大规模 AI 生成人脸图像综合数据库。FaceQ 数据库包含由 29 个模型在三个任务下生成的 12,255 张图像:(1) 人脸生成,(2) 人脸定制,以及 (3) 人脸恢复。它包含来自 180 名标注者的 32,742 个平均意见得分(MOSs),在多个维度上进行评估:质量、真实性、身份(ID)保真度以及文本-图像一致性。利用 FaceQ 数据库,我们建立了 F-Bench,一个用于比较和评估人脸生成、定制与恢复模型的基准,突出了在各种提示词和评估维度上的优势与不足。此外,我们评估了现有图像质量评估(IQA)、人脸质量评估(FQA)、AI 生成内容图像质量评估(AIGCIQA)以及偏好评估指标的性能,表明这些标准指标在评估真实性、ID 保真度和文本-图像一致性方面相对无效。FaceQ 数据库将在发表后公开提供。
引用
@article{arxiv.2412.13155,
title = {F-Bench: Rethinking Human Preference Evaluation Metrics for Benchmarking Face Generation, Customization, and Restoration},
author = {Lu Liu and Huiyu Duan and Qiang Hu and Liu Yang and Chunlei Cai and Tianxiao Ye and Huayu Liu and Xiaoyun Zhang and Guangtao Zhai},
journal= {arXiv preprint arXiv:2412.13155},
year = {2025}
}