相对分类准确率:细粒度 K-pop 人脸生成中身份一致性的校准指标
计算机视觉与模式识别
2026-01-23 v1
摘要
去噪扩散概率模型(DDPM)在高保真图像生成方面取得了显著成功。然而,评估其语义可控性——特别是针对细粒度的单领域任务——仍然具有挑战性。FID 和 Inception Score(IS)等标准指标在此类专门场景中通常无法检测到身份不对齐。在这项工作中,我们研究了用于 K-pop 偶像人脸生成(32x32)的类条件 DDPM,该领域的特征是类间相似度极高。我们提出了一种校准指标——相对分类准确率,它通过 Oracle 分类器的基线对生成性能进行归一化。我们的评估揭示了一个关键的权衡:虽然模型实现了高视觉质量(FID 8.93),但存在严重的语义模式崩溃(RCA 0.27),特别是在视觉上具有歧义的身份上。我们通过混淆矩阵分析了这些失败模式,并将其归因于分辨率限制和性别内部歧义。我们的框架为验证条件生成模型中的身份一致性提供了严格的标准。
引用
@article{arxiv.2601.15560,
title = {Relative Classification Accuracy: A Calibrated Metric for Identity Consistency in Fine-Grained K-pop Face Generation},
author = {Sylvey Lin and Eranki Vasistha},
journal= {arXiv preprint arXiv:2601.15560},
year = {2026}
}