基于半监督学习的端到端富转写风格自动语音识别
计算与语言
2021-07-13 v1 机器学习
声音
音频与语音处理
摘要
我们提出一种半监督学习方法,用于从小规模富转写风格和大规模常规转写风格数据集构建端到端富转写风格自动语音识别(RT-ASR)系统。在自发语音任务中,常包含填充词、词语碎片、笑声与咳嗽等多种语音现象。常规转写不对这些现象作特殊标注,而富转写将它们与文本标记一同显式转换为特殊现象标记。在以往研究中,文本与现象标记以端到端方式同时估计。然而,由于大规模富转写风格数据集往往难以获取,构建准确的 RT-ASR 系统十分困难。为解决该问题,我们的训练方法同时使用了有限的富转写风格数据集与常规转写风格数据集。我们半监督学习的关键过程是将常规转写风格数据集转换为伪富转写风格数据集。为此,我们在基于 transformer 的自回归建模中引入控制现象标记是否生成的风格标记。我们利用该建模生成伪富转写风格数据集,并基于伪数据集与原始数据集构建 RT-ASR 系统。我们在自发语音 ASR 任务上的实验表明了所提方法的有效性。
引用
@article{arxiv.2107.05382,
title = {End-to-End Rich Transcription-Style Automatic Speech Recognition with Semi-Supervised Learning},
author = {Tomohiro Tanaka and Ryo Masumura and Mana Ihori and Akihiko Takashima and Shota Orihashi and Naoki Makishima},
journal= {arXiv preprint arXiv:2107.05382},
year = {2021}
}
备注
Accepted at Interspeech 2021