面向 Transformer 语音识别的可适配多领域语言模型
音频与语音处理
2021-02-12 v2 计算与语言
声音
摘要
我们提出一种基于适配器的多领域 Transformer 语言模型(LM),用于 Transformer 语音识别(ASR)。该模型由一个大尺寸通用 LM 和小尺寸适配器组成。模型仅需小尺寸适配器及其相关层即可实现多领域适配。所提模型可复用使用原始模型全部层微调得到的完整微调 LM。所提 LM 可通过为第一个领域添加约 2% 的参数、为第二个领域之后添加 13% 的参数扩展至新领域。所提模型还能有效降低模型维护成本,因为可省去昂贵且耗时的通用 LM 预训练过程。使用所提基于适配器的方法,我们观察到带适配器的通用 LM 在词错误率(WER)方面优于专用的音乐领域 LM。
关键词
引用
@article{arxiv.2008.06208,
title = {Adaptable Multi-Domain Language Model for Transformer ASR},
author = {Taewoo Lee and Min-Joong Lee and Tae Gyoon Kang and Seokyeoung Jung and Minseok Kwon and Yeona Hong and Jungin Lee and Kyoung-Gu Woo and Ho-Gyeong Kim and Jiseung Jeong and Jihyun Lee and Hosik Lee and Young Sang Choi},
journal= {arXiv preprint arXiv:2008.06208},
year = {2021}
}
备注
This paper is accepted for presentation at IEEE International Conference on Acoustics, Speech and Signal Processing (IEEE ICASSP), 2021