利用发音嵌入点积进行口语词检测与相关度分数估计
计算与语言
2022-10-24 v1 声音
音频与语音处理
摘要
本文描述了一种利用深度 LSTM 网络在大型口语档案中进行口语词检测(STD)的新方法。该工作基于先前使用连体神经网络进行 STD 的方法,并自然地将其扩展为直接定位口语词并估计其相关度分数。由音素识别器生成的音素混淆网络经深度 LSTM 网络处理,该网络将混淆网络的每个片段投影到嵌入空间。所搜索词经另一个深度 LSTM 网络投影到同一嵌入空间。随后在嵌入空间中使用简单的点积计算相关度分数,并用 sigmoid 函数校准以预测出现概率。然后从输出概率序列中估计所搜索词的位置。深度 LSTM 网络以自监督方式从词级与音素级的成对识别假设进行训练。该方法在 MALACH 数据上的英语与捷克语中进行了实验评估。
引用
@article{arxiv.2210.11895,
title = {Spoken Term Detection and Relevance Score Estimation using Dot-Product of Pronunciation Embeddings},
author = {Jan Švec and Luboš Šmídl and Josef V. Psutka and Aleš Pražák},
journal= {arXiv preprint arXiv:2210.11895},
year = {2022}
}