中文

利用切换令牌对多种口语-文本风格转换任务进行零样本联合建模

计算与语言 2021-06-24 v1

摘要

本文提出一种新颖的口语-文本风格转换方法,能够在无需准备匹配数据集的情况下,同时执行标点恢复与不流畅删除等多种风格转换模块。实际上,自动语音识别系统生成的转写文本可读性不高,因为它们常包含许多不流畅之处且不含标点符号。为提升可读性,由于同时处理多种转换任务的匹配数据集往往不可用,通常将各自建模单一转换任务的多个口语-文本风格转换模块级联。然而,由于转换误差的传递,级联对任务顺序不稳定。此外,级联的计算成本必然高于单一转换。为在无需准备匹配数据集的情况下同时执行多种转换任务,我们的核心思想是利用开关区分各个转换任务。在我们提出的零样本联合建模中,使用多个切换令牌来开启或关闭各任务,使我们能够利用零样本学习方法执行同步转换。我们在不流畅删除与标点恢复联合建模上的实验证明了方法的有效性。

关键词

引用

@article{arxiv.2106.12131,
  title  = {Zero-Shot Joint Modeling of Multiple Spoken-Text-Style Conversion Tasks using Switching Tokens},
  author = {Mana Ihori and Naoki Makishima and Tomohiro Tanaka and Akihiko Takashima and Shota Orihashi and Ryo Masumura},
  journal= {arXiv preprint arXiv:2106.12131},
  year   = {2021}
}

备注

Accepted at INTERSPEECH 2021