面向文本到图像生成的可验证且可复现的人工评估
计算机视觉与模式识别
2023-04-05 v1
摘要
人工评估对于验证文本到图像生成模型的性能至关重要,因为这一高度认知的过程需要深度理解文本与图像。然而,我们对近期37篇论文的调研显示,许多工作仅依赖自动度量(如FID)或进行了描述不清、不可靠且不可重复的人工评估。本文提出一种标准化且明确定义的人工评估协议,以促进未来工作中可验证且可复现的人工评估。在我们的试点数据收集中,我们通过实验表明,当前的自动度量在评估文本到图像生成结果性能时与人类感知不一致。此外,我们为可靠且确凿地设计人工评估实验提供了见解。最后,我们向社区公开了若干资源,以促进轻松且快速的实现。
引用
@article{arxiv.2304.01816,
title = {Toward Verifiable and Reproducible Human Evaluation for Text-to-Image Generation},
author = {Mayu Otani and Riku Togashi and Yu Sawai and Ryosuke Ishigami and Yuta Nakashima and Esa Rahtu and Janne Heikkilä and Shin'ichi Satoh},
journal= {arXiv preprint arXiv:2304.01816},
year = {2023}
}
备注
CVPR 2023