TIGEr:用于图像描述评估的文本到图像接地度量
计算与语言
2019-09-06 v1 计算机视觉与模式识别
摘要
本文提出一种称为 TIGEr 的新度量,用于图像描述系统的自动评估。诸如 BLEU 与 CIDEr 等流行度量仅基于参考描述与机器生成描述之间的文本匹配,可能因参考未必完全覆盖图像内容且自然语言固有歧义而导致有偏评估。基于一个机器学习得到的文本-图像接地模型,TIGEr 不仅可根据描述表征图像内容的优劣,还可根据机器生成描述与人类生成描述的匹配程度来评估描述质量。我们的实证测试表明,TIGEr 比现有替代度量具有更高的人类判断一致性。我们还通过测量人类判断与度量分数之间的相关性,全面评估了该度量在描述评估中的有效性。
引用
@article{arxiv.1909.02050,
title = {TIGEr: Text-to-Image Grounding for Image Caption Evaluation},
author = {Ming Jiang and Qiuyuan Huang and Lei Zhang and Xin Wang and Pengchuan Zhang and Zhe Gan and Jana Diesner and Jianfeng Gao},
journal= {arXiv preprint arXiv:1909.02050},
year = {2019}
}