中文

基于视觉接地未转写语音的大规模表示学习

计算机视觉与模式识别 2019-09-20 v1 计算与语言 声音 音频与语音处理

摘要

能够将图像与其口语音频描述相关联的系统是迈向视觉接地语言学习的重要一步。我们描述了一种可扩展的方法,用于为图像描述数据集自动生成多样化音频。这支持对编码音频与图像的深度网络进行预训练,我们通过一个双重编码器来实现,该编码器学习对齐来自两种模态的潜在表示。我们表明,对此类模型使用掩码间隔softmax损失优于标准三元组损失。我们在Flickr8k Audio Captions Corpus上微调这些模型并取得了最先进的结果——将前10召回率从29.6%提升至49.5%。我们还对检索输出进行了人工评分,以更好地评估数据中未关联却偶然匹配的图像-描述对的影响,发现自动评估大幅低估了检索结果的质量。

关键词

引用

@article{arxiv.1909.08782,
  title  = {Large-scale representation learning from visually grounded untranscribed speech},
  author = {Gabriel Ilharco and Yuan Zhang and Jason Baldridge},
  journal= {arXiv preprint arXiv:1909.08782},
  year   = {2019}
}