基于大规模人工评估的图像描述质量估计
计算与语言
2021-06-03 v2 计算机视觉与模式识别
摘要
自动图像描述在过去几年中取得了显著改进,但该问题远未解决,最先进的模型在真实应用场景中仍经常产生低质量的描述。在本文中,我们关注图像描述的质量估计(QE)任务,该任务试图从人类视角对描述质量进行建模,且无需真实参考文本,从而可在预测时应用于检测在先前未见图像上产生的低质量描述。针对该任务,我们开发了一种人工评估流程,从众包用户处收集粗粒度描述标注,并用于收集一个涵盖超过 60 万条描述质量评分的大规模数据集。随后我们仔细验证了所收集评分的质量,并为这一新的 QE 任务建立了基线模型。最后,我们进一步从训练有素的评分员处收集细粒度描述质量标注,并用其证明在粗粒度评分上训练的 QE 模型能够有效检测并过滤低质量图像描述,从而改善描述系统的用户体验。
引用
@article{arxiv.1909.03396,
title = {Quality Estimation for Image Captions Based on Large-scale Human Evaluations},
author = {Tomer Levinboim and Ashish V. Thapliyal and Piyush Sharma and Radu Soricut},
journal= {arXiv preprint arXiv:1909.03396},
year = {2021}
}
备注
10 pages, 6 figures, 3 tables. Accepted to NAACL2021. https://www.aclweb.org/anthology/2021.naacl-main.253/