中文

基于LLM的说话人日志校正:一种可泛化的方法

音频与语音处理 2025-03-18 v3 计算与语言

摘要

说话人日志化对于解释使用自动语音识别(ASR)工具转录的对话是必要的。尽管日志化方法取得了显著进展,但日志化准确性仍然是一个问题。在这里,我们研究了使用大型语言模型(LLM)作为后处理步骤进行日志化校正。使用Fisher语料库(一个大型转录对话数据集)对LLM进行了微调。测量了模型在Fisher语料库的保留数据集以及独立数据集上提高日志化准确性的能力。我们报告说,微调的LLM可以显著提高日志化准确性。然而,模型性能仅限于使用与微调所用转录相同的ASR工具生成的转录,限制了泛化性。为了解决这一限制,开发了一个集成模型,通过组合三个独立模型的权重,每个模型使用不同ASR工具的转录进行微调。集成模型表现出比每个ASR特定模型更好的整体性能,表明可能实现一种可泛化且与ASR无关的方法。我们已在HuggingFace上公开了这些模型的权重:https://huggingface.co/bklynhlth。

关键词

引用

@article{arxiv.2406.04927,
  title  = {LLM-based speaker diarization correction: A generalizable approach},
  author = {Georgios Efstathiadis and Vijay Yadav and Anzar Abbas},
  journal= {arXiv preprint arXiv:2406.04927},
  year   = {2025}
}