SpeechNet:一种用于语音处理任务的通用模块化模型
计算与语言
2021-06-01 v2 机器学习
声音
音频与语音处理
摘要
语音处理任务种类繁多,从从语音信号中提取内容信息到生成语音信号均有涵盖。对于不同任务,模型网络通常分别设计和调优。若一个通用模型能执行多种语音处理任务,某些任务或可借助从其他任务中学到的相关能力得到提升。利用通用模型对种类广泛的语音处理任务进行多任务学习尚未被研究。本文提出一种通用模块化模型 SpeechNet,其将所有语音处理任务统一为语音/文本输入与语音/文本输出格式。我们选取五项基础语音处理任务,使用 SpeechNet 进行多任务学习实验。我们展示了 SpeechNet 可学习上述所有任务,并进一步分析了哪些任务可被其他任务所提升。SpeechNet 具有模块化特性且灵活,便于未来集成更多模块、任务或训练方法。我们发布了代码与实验设置,以促进模块化通用模型及语音处理任务多任务学习的研究。
引用
@article{arxiv.2105.03070,
title = {SpeechNet: A Universal Modularized Model for Speech Processing Tasks},
author = {Yi-Chen Chen and Po-Han Chi and Shu-wen Yang and Kai-Wei Chang and Jheng-hao Lin and Sung-Feng Huang and Da-Rong Liu and Chi-Liang Liu and Cheng-Kuang Lee and Hung-yi Lee},
journal= {arXiv preprint arXiv:2105.03070},
year = {2021}
}