中文

评估自动生成的音素图像描述

计算与语言 2020-08-03 v1 计算机视觉与模式识别

摘要

Image2Speech 是生成图像口语描述这一相对新颖的任务。本文对该任务的评估进行了研究。为此,首先实现了一个 Image2Speech 系统,其生成由音素序列构成的图像描述。该系统在 Flickr8k 语料库上优于原始的 Image2Speech 系统。随后,将这些音素描述转换为由词组成的句子。由人类评估者对这些描述刻画图像的好坏程度进行评分。最后,将若干客观指标得分与这些人评分数相关联。尽管 BLEU4 与人评并非完全相关,但它在所考察指标中相关性最高,且是当前 Image2Speech 任务的最佳现有指标。现有指标受限于其假设输入为词。更适合 Image2Speech 任务的指标应假设其输入为词的部分,即音素。

关键词

引用

@article{arxiv.2007.15916,
  title  = {Evaluating Automatically Generated Phoneme Captions for Images},
  author = {Justin van der Hout and Zoltán D'Haese and Mark Hasegawa-Johnson and Odette Scharenborg},
  journal= {arXiv preprint arXiv:2007.15916},
  year   = {2020}
}

备注

Accepted at Interspeech2020