基于注意力的多假设融合用于语音摘要
音频与语音处理
2021-11-17 v1 计算与语言
摘要
语音摘要从语音生成文本摘要,可通过结合自动语音识别(ASR)与文本摘要(TS)来实现。采用这种级联方法,我们可以利用两个子任务上最先进的模型与大规模训练数据集,即用于ASR的Transformer和用于TS的来自Transformers的双向编码器表示(BERT)。然而,在级联方法中,ASR错误会直接影响输出摘要的质量。我们提出了一种对ASR错误具有鲁棒性、并利用ASR生成的多个假设来减弱ASR错误对摘要影响的级联语音摘要模型。我们研究了多种组合ASR假设的策略。首先,我们提出将ASR系统提供的后验值加权的子词嵌入向量之和作为基于BERT的TS系统的输入。接着,我们引入一种更通用的策略,在预训练的BERT模块上添加一个基于注意力的融合模块,以对齐并组合多个ASR假设。最后,我们在How2数据集和一篇新整理的基于TED的数据集上进行了语音摘要实验,该数据集将随本文发布。这些实验表明,使用这些策略重新训练基于BERT的TS系统可以提升摘要性能,且基于注意力的融合模块尤为有效。
引用
@article{arxiv.2111.08201,
title = {Attention-based Multi-hypothesis Fusion for Speech Summarization},
author = {Takatomo Kano and Atsunori Ogawa and Marc Delcroix and Shinji Watanabe},
journal= {arXiv preprint arXiv:2111.08201},
year = {2021}
}