LiteG2P:一种快速、轻量且高精度的字素到音素转换模型
计算与语言
2023-03-03 v1 声音
音频与语音处理
摘要
作为自动语音识别(ASR)与文本到语音(TTS)前端的关键组件,字素到音素(G2P)转换承担着将字母转换为对应发音的作用。现有方法或速度慢或性能差,且应用场景受限,尤其在设备端推理过程中。本文融合专家知识与基于连接时序分类(CTC)的神经网络二者优势,提出一种名为 LiteG2P 的新方法,其快速、轻量且理论上可并行。借助精心的前导设计,LiteG2P 可同时应用于云端与设备端。在 CMU 数据集上的实验结果表明,所提方法的性能优于最先进的基于 CTC 的方法,且参数量减少 10 倍,甚至可与最先进的基于 Transformer 的序列到序列模型相媲美,而参数量更少、计算量降低 33 倍。
引用
@article{arxiv.2303.01086,
title = {LiteG2P: A fast, light and high accuracy model for grapheme-to-phoneme conversion},
author = {Chunfeng Wang and Peisong Huang and Yuxiang Zou and Haoyu Zhang and Shichao Liu and Xiang Yin and Zejun Ma},
journal= {arXiv preprint arXiv:2303.01086},
year = {2023}
}
备注
Accepted by ICASSP2023