从视觉接地语音中学习层次化离散语言单元
计算与语言
2020-02-17 v2 机器学习
声音
音频与语音处理
摘要
在本文中,我们提出了一种通过学习将向量量化层纳入视觉接地语音的神经模型来学习离散语言单元的方法。我们表明,根据配置方式的不同,我们的方法能够捕获词级和子词单元。本文与先前关于语音单元学习的工作的不同之处在于训练目标的选择。我们不使用基于重构的损失,而是使用判别性的多模态接地目标,迫使所学单元对语义图像检索有用。我们在 ZeroSpeech 2019 挑战赛上评估了子词单元,在保持比特率大致相同的情况下,ABX 错误率比较佳提交降低了 27.3%。我们还给出了证明这些单元噪声鲁棒性的实验。最后,我们展示了具有多个量化器的模型可以在较低层同时学习类音素检测器,在较高层学习类词检测器。我们表明这些检测器高度准确,发现了 279 个词,F1 分数大于 0.5。
引用
@article{arxiv.1911.09602,
title = {Learning Hierarchical Discrete Linguistic Units from Visually-Grounded Speech},
author = {David Harwath and Wei-Ning Hsu and James Glass},
journal= {arXiv preprint arXiv:1911.09602},
year = {2020}
}
备注
Camera-ready version for ICLR