DiarizationLM:利用大语言模型进行说话人日志后处理
音频与语音处理
2025-01-10 v9 机器学习
声音
摘要
在本文中,我们介绍了 DiarizationLM,这是一个利用大语言模型(LLM)对说话人日志系统输出进行后处理的框架。该框架可实现多种目标,例如提高日志化转录稿的可读性,或降低词级说话人日志错误率(WDER)。在该框架中,自动语音识别(ASR)和说话人日志系统的输出被表示为紧凑的文本格式,并包含在提示中以输入到可选微调的 LLM 中。LLM 的输出可用作具有所需增强效果的精炼日志结果。作为后处理步骤,该框架可轻松应用于任何现成的 ASR 和说话人日志系统,而无需重新训练现有组件。我们的实验表明,微调后的 PaLM 2-S 模型在 Fisher 电话对话数据集上将 WDER 相对降低了 55.5%,在 Callhome 英语数据集上相对降低了 44.9%。
引用
@article{arxiv.2401.03506,
title = {DiarizationLM: Speaker Diarization Post-Processing with Large Language Models},
author = {Quan Wang and Yiling Huang and Guanlong Zhao and Evan Clark and Wei Xia and Hank Liao},
journal= {arXiv preprint arXiv:2401.03506},
year = {2025}
}