以合成音频替代人类音频用于端侧未发声标点预测
机器学习
2021-02-12 v2 计算与语言
声音
音频与语音处理
摘要
我们提出一种新颖的英语多模态未发声标点预测系统,其结合了声学与文本特征。我们首次证明,通过完全依赖使用韵律感知文本转语音系统生成的合成数据,可在未发声标点预测问题上优于使用昂贵人类音频录音训练的模型。我们的模型架构非常适于端侧使用。这是通过利用基于哈希的自动语音识别文本输出嵌入,并结合声学特征作为准循环神经网络的输入来实现的,从而保持模型规模小且延迟低。
引用
@article{arxiv.2010.10203,
title = {Replacing Human Audio with Synthetic Audio for On-device Unspoken Punctuation Prediction},
author = {Daria Soboleva and Ondrej Skopek and Márius Šajgalík and Victor Cărbune and Felix Weissenberger and Julia Proskurnia and Bogdan Prisacari and Daniel Valcarce and Justin Lu and Rohit Prabhavalkar and Balint Miklos},
journal= {arXiv preprint arXiv:2010.10203},
year = {2021}
}
备注
Accepted to IEEE ICASSP 2021