g2pW:一种用于普通话多音字消歧的条件加权Softmax BERT
计算与语言
2022-08-26 v5 声音
音频与语音处理
摘要
多音字消歧是普通话字到音(grapheme-to-phoneme, g2p)转换中最关键的任务。以往研究采用预训练语言模型、受限输出以及来自词性(Part-Of-Speech, POS)标注的额外信息来解决该问题。受这些策略启发,我们提出一种称为g2pW的新方法,其利用可学习的softmax权重,以目标多音字及其POS标注为条件来调节BERT的输出。与以往工作使用硬掩码不同,我们的实验表明,为候选音素学习一个软加权函数有助于性能提升。此外,我们的g2pW在使用POS标签作为辅助特征时不需要额外的预训练POS标注模型,因为我们以统一编码器同时训练POS标注模型。实验结果表明,我们的g2pW在公开CPP数据集上优于现有方法。所有代码、模型权重及用户友好包均已公开。
引用
@article{arxiv.2203.10430,
title = {g2pW: A Conditional Weighted Softmax BERT for Polyphone Disambiguation in Mandarin},
author = {Yi-Chang Chen and Yu-Chuan Chang and Yen-Cheng Chang and Yi-Ren Yeh},
journal= {arXiv preprint arXiv:2203.10430},
year = {2022}
}
备注
Accepted in INTERSPEECH 2022