语音中超音段特征的自动识别
计算与语言
2021-08-05 v2
摘要
本研究报告了我们通过使用 CTC 微调 wav2vec 2.0 来改进超音段特征自动识别的努力,该方法已在自动语音识别中取得成功。我们证明,该方法能够提升音节、声调和音高重音自动识别的最新技术水平。通过使用带调韵母或带调音节作为识别单元来利用音段信息,可以显著提高普通话声调识别性能。当使用带调音节作为识别单元时,语言模型是有帮助的,但当声调作为识别单元时则无帮助。最后,通过在微调 wav2vec 2.0 时结合普通话声调识别与英语音素识别这两个任务,可以使普通话声调识别从中受益。
引用
@article{arxiv.2108.01122,
title = {Automatic recognition of suprasegmentals in speech},
author = {Jiahong Yuan and Neville Ryant and Xingyu Cai and Kenneth Church and Mark Liberman},
journal= {arXiv preprint arXiv:2108.01122},
year = {2021}
}
备注
submitted to ASRU 2021