HYPE:生成模型人类视觉感知评估基准
计算机视觉与模式识别
2019-11-04 v4 人机交互
机器学习
摘要
生成模型常使用人类评估来衡量其输出感知质量。自动化指标是含噪的间接代理,因为它们依赖启发式或预训练嵌入。然而,迄今为止,直接人类评估策略一直是临时的,既未标准化也未经验证。我们的工作建立了生成真实感的人类基准黄金标准。我们构建了人类视觉感知评估(HYPE)这一人类基准,其(1)基于感知的心理物理学研究,(2)在不同随机采样模型输出集上可靠,(3)能够产生可分离的模型性能,且(4)在成本和时间上高效。我们引入两种变体:一种在自适应时间约束下测量视觉感知以确定模型输出显得真实的时间阈值(如 250ms),另一种较便宜的变体测量人类在无时间约束下对假图和真图的错误率。我们在六个最先进的生成对抗网络以及两种采样技术上,使用四个数据集(CelebA、FFHQ、CIFAR-10 和 ImageNet)对条件和无条件图像生成测试了 HYPE。我们发现 HYPE 可追踪训练周期中模型的改进,并通过 bootstrap 采样确认 HYPE 排名一致且可复现。
引用
@article{arxiv.1904.01121,
title = {HYPE: A Benchmark for Human eYe Perceptual Evaluation of Generative Models},
author = {Sharon Zhou and Mitchell L. Gordon and Ranjay Krishna and Austin Narcomey and Li Fei-Fei and Michael S. Bernstein},
journal= {arXiv preprint arXiv:1904.01121},
year = {2019}
}
备注
https://hype.stanford.edu