中文

基于大语言模型的端到端语音摘要

计算与语言 2024-07-03 v1 声音 音频与语音处理

摘要

抽象式语音摘要(SSum)旨在从语音内容生成类人文本摘要。在处理长语音输入和捕捉语音输入与短文本摘要之间复杂跨模态映射方面存在困难。大语言模型(LLM)和多模态信息融合的研究为解决这些问题提供了新思路。本文提出一种端到端SSum模型,利用Q-Former作为音频-文本模态的连接器,并利用LLM直接从语音特征生成文本摘要。我们采用多阶段训练方法,包括基于LLM的语音识别(ASR)和文本摘要(TSum)任务作为辅助任务。ASR任务用于对齐特征空间,增强LLM处理更长语音的能力。随后,我们采用课程学习策略以促进模型从TSum向SSum的过渡。最终,我们的模型在How-2数据集上取得了竞争性的性能。

关键词

引用

@article{arxiv.2407.02005,
  title  = {An End-to-End Speech Summarization Using Large Language Model},
  author = {Hengchao Shang and Zongyao Li and Jiaxin Guo and Shaojun Li and Zhiqiang Rao and Yuanchang Luo and Daimeng Wei and Hao Yang},
  journal= {arXiv preprint arXiv:2407.02005},
  year   = {2024}
}

备注

InterSpeech 2024