用于TTS前端文本处理的多任务学习
计算与语言
2024-04-04 v1
摘要
我们提出了一种多任务学习(MTL)模型,用于联合执行文本转语音(TTS)前端中通常解决的三个任务:文本归一化(TN)、词性标注(POS)和同形异义词消歧(HD)。我们的框架采用树状结构,包含一个学习共享表示的主干,后跟独立的特定任务头部。我们进一步整合了一个预训练语言模型,以利用其内置的词汇和上下文知识,并研究如何最好地使用其嵌入,以便最有效地使我们的多任务模型受益。通过任务级消融实验,我们表明,与在单个任务或子任务组合上训练的模型相比,在所有三个任务上训练的完整模型实现了最强的整体性能,证实了我们的MTL框架的优势。最后,我们引入了一个新的HD数据集,其中包含各种同形异义词及其发音在不同上下文中的平衡句子数量。我们证明,将这一数据集纳入训练,与仅使用一个常用但不平衡的现有数据集相比,显著提高了HD性能。
引用
@article{arxiv.2401.06321,
title = {Multi-Task Learning for Front-End Text Processing in TTS},
author = {Wonjune Kang and Yun Wang and Shun Zhang and Arthur Hinsvark and Qing He},
journal= {arXiv preprint arXiv:2401.06321},
year = {2024}
}
备注
ICASSP 2024