中文

基于声学条件化的大语言模型说话人错误纠正方法SEAL

音频与语音处理 2025-01-16 v1 人工智能 计算与语言 机器学习 声音

摘要

说话人分割(SD)是现代端到端语音识别(ASR)管道中的关键组件。传统的SD系统通常基于音频且独立于ASR,在说话人转换和重叠语peech时常引入说话人错误。最近,包括微调的大语言模型(LLM)在内的语言模型显示出作为第二-pass说话人错误纠正器的有效性,通过利用转录输出中的词汇上下文。本文引入一种新的声学条件化方法,以提供来自声学分割器对LLM的更细粒度信息。我们还展示了一种更简单的受限解码策略可减少LLM幻觉,同时避免复杂的后处理。我们的方法在Fisher、Callhome和RT03-CTS数据集上相对于第一-pass声学SD显著降低了说话人错误率,降低幅度为24%-43%。

关键词

引用

@article{arxiv.2501.08421,
  title  = {SEAL: Speaker Error Correction using Acoustic-conditioned Large Language Models},
  author = {Anurag Kumar and Rohit Paturi and Amber Afshan and Sundararajan Srinivasan},
  journal= {arXiv preprint arXiv:2501.08421},
  year   = {2025}
}

备注

Accepted at ICASSP 2025