中文

深入表层之下:评估图像描述生成的语法性、真实性与多样性

计算与语言 2019-12-20 v1

摘要

图像描述生成作为一项多模态任务近年来引起了广泛关注。然而,该任务的评估仍是一个具有挑战性的问题。现有评估指标聚焦于候选描述与一组参考描述之间的表层相似性,而不检查描述与底层视觉内容之间的实际关系。我们为图像描述生成任务引入了一种新的诊断性评估框架,旨在直接评估所生成描述的语法性、真实性与多样性(GTD)。我们通过在我们为诊断评估构建的广泛合成数据集上评估现有图像描述生成模型,展示了我们评估框架的潜力。我们凭经验表明,GTD 评估框架与诊断数据集相结合,如何能够提供对模型能力与局限的洞察,以补充标准评估。

关键词

引用

@article{arxiv.1912.08960,
  title  = {Going Beneath the Surface: Evaluating Image Captioning for Grammaticality, Truthfulness and Diversity},
  author = {Huiyuan Xie and Tom Sherborne and Alexander Kuhnle and Ann Copestake},
  journal= {arXiv preprint arXiv:1912.08960},
  year   = {2019}
}