TISE:用于文本到图像合成评估的指标集
计算机视觉与模式识别
2022-07-20 v2
摘要
本文中,我们对文本到图像合成的最先进方法进行了研究,并提出了一个评估这些方法的框架。我们考虑图像包含单个或多个物体的合成情况。我们的研究指出了当前评估流程中的若干问题:(i) 对于图像质量评估,常用指标(如 Inception Score (IS))在单物体情形下常校准不当,或在多物体情形下被误用;(ii) 对于文本相关性与物体准确性评估,现有的 R-precision (RP) 与 Semantic Object Accuracy (SOA) 指标分别存在过拟合现象;(iii) 对于多物体情形,许多重要的评估因素(如物体保真度、位置对齐、计数对齐)被大幅忽略;(iv) 基于当前指标的方法排序与真实图像高度不一致。为克服这些问题,我们提出了一组结合已有与新指标的集合,以系统性评估这些方法。对于已有指标,我们通过对 IS 所用分类器置信度进行温度缩放,给出了名为 IS* 的改进版 IS;我们还提出了缓解 RP 与 SOA 过拟合问题的方案。对于新指标,我们开发了用于多物体情形评估的计数对齐、位置对齐、以物体为中心的 IS 以及以物体为中心的 FID 指标。我们表明,使用我们的指标集进行基准测试,可在现有方法间产生与人工评估高度一致的排序。作为副产品,我们通过使用谱归一化稳定 AttnGAN 的训练,创建了 AttnGAN++,一个简单但强大的基准模型。我们还发布了我们的工具箱,即 TISE,以倡导对文本到图像模型进行公平且一致的评估。
引用
@article{arxiv.2112.01398,
title = {TISE: Bag of Metrics for Text-to-Image Synthesis Evaluation},
author = {Tan M. Dinh and Rang Nguyen and Binh-Son Hua},
journal= {arXiv preprint arXiv:2112.01398},
year = {2022}
}
备注
Accepted to ECCV 2022; TISE toolbox is available at https://github.com/VinAIResearch/tise-toolbox