基于声学条件化的大语言模型说话人错误纠正方法SEAL
音频与语音处理
2025-01-16 v1 人工智能
计算与语言
机器学习
声音
摘要
说话人分割(SD)是现代端到端语音识别(ASR)管道中的关键组件。传统的SD系统通常基于音频且独立于ASR,在说话人转换和重叠语peech时常引入说话人错误。最近,包括微调的大语言模型(LLM)在内的语言模型显示出作为第二-pass说话人错误纠正器的有效性,通过利用转录输出中的词汇上下文。本文引入一种新的声学条件化方法,以提供来自声学分割器对LLM的更细粒度信息。我们还展示了一种更简单的受限解码策略可减少LLM幻觉,同时避免复杂的后处理。我们的方法在Fisher、Callhome和RT03-CTS数据集上相对于第一-pass声学SD显著降低了说话人错误率,降低幅度为24%-43%。
引用
@article{arxiv.2501.08421,
title = {SEAL: Speaker Error Correction using Acoustic-conditioned Large Language Models},
author = {Anurag Kumar and Rohit Paturi and Amber Afshan and Sundararajan Srinivasan},
journal= {arXiv preprint arXiv:2501.08421},
year = {2025}
}
备注
Accepted at ICASSP 2025