看图说话:直接合成图像的口语化描述
计算机视觉与模式识别
2020-11-18 v2 计算与语言
摘要
本文提出一种称为看图说话(SAS)模型的新模型,该模型首次能够直接合成图像的口语化描述,无需任何文本或音素。SAS 的基本结构为编码器-解码器架构,以图像为输入并预测描述该图像语音的频谱图。最终语音音频由预测的频谱图经 WaveNet 获得。在公开基准数据库 Flickr8k 上的大量实验表明,所提出的 SAS 能够为图像合成自然的口语化描述,表明绕过文本与音素直接合成图像口语化描述是可行的。
引用
@article{arxiv.2010.12267,
title = {Show and Speak: Directly Synthesize Spoken Description of Images},
author = {Xinsheng Wang and Siyuan Feng and Jihua Zhu and Mark Hasegawa-Johnson and Odette Scharenborg},
journal= {arXiv preprint arXiv:2010.12267},
year = {2020}
}