中文

基于分组预测模型的个性化填充停顿生成

声音 2022-04-25 v2 音频与语音处理

摘要

本文提出一种利用分组预测模型生成个性化填充停顿(FPs)的方法。与流利文本生成相比,不流利文本生成尚未被广泛探索。为生成更拟人化的文本,我们着手于不流利文本生成。不流利现象(如填充停顿、改写和词片段)的使用因说话者而异,因此需要生成个性化填充停顿。然而,由于其位置稀疏性以及高频与低频填充停顿的使用频率差异,预测它们较为困难。此外,由于各说话者内部倾向差异较大,有时难以将填充停顿预测模型适配到每个说话者。为解决这些问题,我们提出一种基于说话者使用填充停顿的倾向进行分组、构建组依赖预测模型的方法。该方法不需要大量数据和时间来训练每个说话者模型。我们进一步引入了适用于填充停顿预测的损失函数和词嵌入模型。实验结果表明,组依赖模型比非个性化模型获得更高的填充停顿预测分数,且所引入的损失函数和词嵌入模型提升了预测性能。

关键词

引用

@article{arxiv.2203.09961,
  title  = {Personalized Filled-pause Generation with Group-wise Prediction Models},
  author = {Yuta Matsunaga and Takaaki Saeki and Shinnosuke Takamichi and Hiroshi Saruwatari},
  journal= {arXiv preprint arXiv:2203.09961},
  year   = {2022}
}

备注

Accepted to LREC 2022