评估自动生成的音素图像描述
计算与语言
2020-08-03 v1 计算机视觉与模式识别
摘要
Image2Speech 是生成图像口语描述这一相对新颖的任务。本文对该任务的评估进行了研究。为此,首先实现了一个 Image2Speech 系统,其生成由音素序列构成的图像描述。该系统在 Flickr8k 语料库上优于原始的 Image2Speech 系统。随后,将这些音素描述转换为由词组成的句子。由人类评估者对这些描述刻画图像的好坏程度进行评分。最后,将若干客观指标得分与这些人评分数相关联。尽管 BLEU4 与人评并非完全相关,但它在所考察指标中相关性最高,且是当前 Image2Speech 任务的最佳现有指标。现有指标受限于其假设输入为词。更适合 Image2Speech 任务的指标应假设其输入为词的部分,即音素。
关键词
引用
@article{arxiv.2007.15916,
title = {Evaluating Automatically Generated Phoneme Captions for Images},
author = {Justin van der Hout and Zoltán D'Haese and Mark Hasegawa-Johnson and Odette Scharenborg},
journal= {arXiv preprint arXiv:2007.15916},
year = {2020}
}
备注
Accepted at Interspeech2020