通过隐空间合成高效利用文本数据改进端到端语音处理
计算与语言
2023-10-25 v3 机器学习
声音
音频与语音处理
摘要
在以数据为中心的人工智能时代,训练高性能端到端语音(E2E)处理模型需要海量标注语音数据。然而,相较于文本数据,标注语音数据通常更稀缺且采集成本更高。我们提出 Latent Synthesis(LaSyn),一种面向 E2E 语音处理模型的高效文本数据利用框架。我们训练一个隐空间合成器,将文本数据转换为预训练语音模型的中间隐表示。这些文本数据的伪声学表示扩充了用于模型训练的声学数据。我们在低资源自动语音识别(ASR)与口语语言理解(SLU)任务上评估 LaSyn。对于 ASR,LaSyn 改进了在 LibriSpeech train-clean-100 上训练的 E2E 基线,在不同测试集上相对词错率降低超过 22.3%。对于 SLU,LaSyn 在 SLURP 上将我们的 E2E 基线绝对提升意图分类准确率 4.1%、槽填充 SLU-F1 3.8%,并在 STOP 上分别绝对提升精确匹配(EM)与 EM-Tree 准确率 4.49% 与 2.25%。以更少参数,LaSyn 的结果可与已发表的最优(SOTA)工作相媲美。结果证明了扩充训练数据的质量。
引用
@article{arxiv.2310.05374,
title = {Improving End-to-End Speech Processing by Efficient Text Data Utilization with Latent Synthesis},
author = {Jianqiao Lu and Wenyong Huang and Nianzu Zheng and Xingshan Zeng and Yu Ting Yeung and Xiao Chen},
journal= {arXiv preprint arXiv:2310.05374},
year = {2023}
}
备注
15 pages, 8 figures, 8 tables, Accepted to EMNLP 2023 Findings