中文

BASS:面向语音摘要的块级自适应方法

计算与语言 2023-07-18 v1 声音 音频与语音处理

摘要

端到端语音摘要已被证明优于级联基线。然而,由于计算限制,此类模型难以在极长输入(数十分钟或数小时)上训练,因此使用截断的模型输入进行训练。截断导致模型性能变差,解决该问题的途径在于块级建模,即每次处理一部分输入帧。本文中,我们开发了一种以增量方式在极长序列上训练摘要模型的方法。语音摘要被实现为一个流式过程,其中假设摘要在每个块上基于新声学信息更新。我们设计并测试了在块间传递语义上下文的策略。在 How2 数据集上的实验表明,所提出的块级训练方法相较截断输入基线在 ROUGE-L 上绝对提升 3 个点。

关键词

引用

@article{arxiv.2307.08217,
  title  = {BASS: Block-wise Adaptation for Speech Summarization},
  author = {Roshan Sharma and Kenneth Zheng and Siddhant Arora and Shinji Watanabe and Rita Singh and Bhiksha Raj},
  journal= {arXiv preprint arXiv:2307.08217},
  year   = {2023}
}

备注

Accepted at Interspeech 2023