面向爱沙尼亚语语音的高级丰富转录系统
计算与语言
2022-03-30 v1 音频与语音处理
摘要
本文描述了当前塔林理工大学(TTÜ)针对爱沙尼亚语语音的转录系统。该系统设计用于处理半自发语音,例如在不同声学条件下录制的广播对话、讲座录音和访谈。系统基于Kaldi工具包。使用从未转写数据中自动提取的背景噪声轮廓进行多条件训练,以提高系统的鲁棒性。集外词通过使用基于音素n元文法的译码子图和基于FST的音素到字位模型来恢复。该系统在广播对话测试集上取得了8.1%的词错误率。该系统还执行标点恢复和说话人识别。说话人识别模型使用最近提出的弱监督训练方法进行训练。
引用
@article{arxiv.1901.03601,
title = {Advanced Rich Transcription System for Estonian Speech},
author = {Tanel Alumäe and Ottokar Tilk and Asadullah},
journal= {arXiv preprint arXiv:1901.03601},
year = {2022}
}
备注
Published in Baltic HLT 2018 (putting it on arXiv because Google Scholar doesn't index it properly)