学习用于发音变化的相似度函数
计算与语言
2017-06-20 v3
摘要
自动语音识别(ASR)系统中的一个重要错误来源是自发和对话语音中出现的发音变化。通常,ASR 系统使用一个有限词典,为每个词提供一个或多个发音。在本文中,我们专注于学习两个发音之间的相似度函数。这两个发音可以是同一个词的标准发音和表层发音,也可以是不同词的两个表层发音。该任务推广了诸如词汇提取(学习词与其可能发音之间映射的问题)和定义词邻域等问题。它也可用于动态增加发音词典的规模,或用于预测 ASR 错误。我们提出了两种基于循环神经网络的方法来学习相似度函数。第一种基于二元分类,第二种基于学习发音的排序。我们使用 Switchboard 对话语音语料库的一个子集,在词汇提取任务上展示了我们方法的效率。结果表明,在该任务上我们的方法优于先前基于图贝叶斯方法的方法。
引用
@article{arxiv.1703.09817,
title = {Learning Similarity Functions for Pronunciation Variations},
author = {Einat Naaman and Yossi Adi and Joseph Keshet},
journal= {arXiv preprint arXiv:1703.09817},
year = {2017}
}