利用大规模文本语料库实现端到端语音摘要
计算与语言
2023-03-03 v1 音频与语音处理
摘要
端到端语音摘要(E2E SSum)是一种直接从语音生成摘要句子的技术。与结合自动语音识别(ASR)与文本摘要模型的级联方法相比,E2E 方法更具前景,因为它能减轻 ASR 错误、融入非语言信息并简化整体系统。然而,由于收集大量配对数据(即语音与摘要)较为困难,训练数据通常不足以训练鲁棒的 E2E SSum 系统。本文提出两种新颖方法,利用大量外部文本摘要数据用于 E2E SSum 训练。第一种技术是借助文本转语音(TTS)系统生成合成语音,并将其与文本摘要一同用于 E2E SSum 训练。第二种是无 TTS 方法,直接向 E2E SSum 模型输入音素序列而非合成语音。实验表明,我们提出的基于 TTS 与音素的方法在 How2 数据集上改善了多项指标。特别地,我们的最佳系统大幅优于先前最先进的系统(即 METEOR 分数提升超过 6 分)。据我们所知,这是首项将外部语言资源用于 E2E SSum 的工作。此外,我们给出了对 How2 数据集的详细分析,以确认所提 E2E SSum 系统的有效性。
引用
@article{arxiv.2303.00978,
title = {Leveraging Large Text Corpora for End-to-End Speech Summarization},
author = {Kohei Matsuura and Takanori Ashihara and Takafumi Moriya and Tomohiro Tanaka and Atsunori Ogawa and Marc Delcroix and Ryo Masumura},
journal= {arXiv preprint arXiv:2303.00978},
year = {2023}
}
备注
Accepted to ICASSP 2023