中文

g2pW:一种用于普通话多音字消歧的条件加权Softmax BERT

计算与语言 2022-08-26 v5 声音 音频与语音处理

摘要

多音字消歧是普通话字到音(grapheme-to-phoneme, g2p)转换中最关键的任务。以往研究采用预训练语言模型、受限输出以及来自词性(Part-Of-Speech, POS)标注的额外信息来解决该问题。受这些策略启发,我们提出一种称为g2pW的新方法,其利用可学习的softmax权重,以目标多音字及其POS标注为条件来调节BERT的输出。与以往工作使用硬掩码不同,我们的实验表明,为候选音素学习一个软加权函数有助于性能提升。此外,我们的g2pW在使用POS标签作为辅助特征时不需要额外的预训练POS标注模型,因为我们以统一编码器同时训练POS标注模型。实验结果表明,我们的g2pW在公开CPP数据集上优于现有方法。所有代码、模型权重及用户友好包均已公开。

关键词

引用

@article{arxiv.2203.10430,
  title  = {g2pW: A Conditional Weighted Softmax BERT for Polyphone Disambiguation in Mandarin},
  author = {Yi-Chang Chen and Yu-Chuan Chang and Yen-Cheng Chang and Yi-Ren Yeh},
  journal= {arXiv preprint arXiv:2203.10430},
  year   = {2022}
}

备注

Accepted in INTERSPEECH 2022