利用大型语言模型提升多说话人ASR性能
音频与语音处理
2024-09-02 v1 人工智能
摘要
在会话场景中识别多个说话人的重叠语音是自动语音识别(ASR)面临的最具挑战性的问题之一。串行输出训练(SOT)是解决多说话人ASR的一种经典方法,其思路是根据语音的发出时间将多个说话人的转录拼接起来用于训练。然而,由对话中多个相关话语拼接而成的SOT风格转录,在很大程度上依赖于对长上下文的建模。因此,相较于主要强调基于注意力的编码器-解码器(AED)架构中编码器性能的传统方法,一种利用大型语言模型(LLM)并发挥预训练解码器能力的新方法可能更适合此类复杂且具挑战性的场景。在本文中,我们提出了一种基于LLM的SOT方法用于多说话人ASR,利用预训练的语音编码器和LLM,并使用适当的策略在多说话人数据集上对其进行微调。实验结果表明,我们的方法在模拟数据集LibriMix上超越了传统的基于AED的方法,并在真实世界数据集AMI的评估集上取得了最先进的性能,优于以往工作中使用多1000倍监督数据训练的AED模型。
引用
@article{arxiv.2408.17431,
title = {Advancing Multi-talker ASR Performance with Large Language Models},
author = {Mohan Shi and Zengrui Jin and Yaoxun Xu and Yong Xu and Shi-Xiong Zhang and Kun Wei and Yiwen Shao and Chunlei Zhang and Dong Yu},
journal= {arXiv preprint arXiv:2408.17431},
year = {2024}
}
备注
8 pages, accepted by IEEE SLT 2024