从预训练语言模型迁移学习改进端到端语音摘要
计算与语言
2023-06-08 v1 声音
音频与语音处理
摘要
端到端语音摘要(E2E SSum)利用单一模型将输入语音直接摘要为易读的短句。该方法前景广阔,因为与传统的级联方法相比,它能够利用完整的声学信息并减轻转录错误的传播。然而,由于收集语音-摘要对的成本高昂,E2E SSum 模型往往受困于训练数据稀缺与输出不自然语句。为克服此缺陷,我们首次提出通过迁移学习将具备自然语句生成能力的预训练语言模型(LM)整合进 E2E SSum 解码器。此外,为缩小独立预训练的编码器与解码器之间的差距,我们还提出迁移基线 E2E SSum 编码器,而非常用的自动语音识别编码器。实验结果表明,所提模型优于基线与数据增强模型。
引用
@article{arxiv.2306.04233,
title = {Transfer Learning from Pre-trained Language Models Improves End-to-End Speech Summarization},
author = {Kohei Matsuura and Takanori Ashihara and Takafumi Moriya and Tomohiro Tanaka and Takatomo Kano and Atsunori Ogawa and Marc Delcroix},
journal= {arXiv preprint arXiv:2306.04233},
year = {2023}
}
备注
Accepted by Interspeech 2023