SpeeChain:面向大规模机器语音链的开源语音工具包
计算与语言
2023-01-10 v1 机器学习
音频与语音处理
摘要
本文介绍 SpeeChain,一个基于 Pytorch 的开源工具包,旨在开发大规模使用的机器语音链。此首发版本聚焦于 TTS-to-ASR 链(机器语音链的核心组件),即利用未发声文本进行 TTS 数据增强以服务于 ASR。为构建高效的规模化 TTS-to-ASR 链流程,我们实现了易用的多 GPU 批级模型推理、多数据加载器批生成以及在线数据选择技术。本文首先阐述 TTS-to-ASR 链的整体流程及各步骤的难点,随后针对不同类型的无标签数据、数据过滤阈值、批次构成与真实-合成数据比例给出详细的消融研究。我们在 LibriSpeech 的 train_clean_460 上的实验结果表明,我们的 TTS-to-ASR 链能在半监督设定下显著改善 WER。
引用
@article{arxiv.2301.02966,
title = {SpeeChain: A Speech Toolkit for Large-Scale Machine Speech Chain},
author = {Heli Qi and Sashi Novitasari and Andros Tjandra and Sakriani Sakti and Satoshi Nakamura},
journal= {arXiv preprint arXiv:2301.02966},
year = {2023}
}
备注
Submitted to ICASSP 2023