利用冻结大语言模型增强对话标注中的说话人特征
计算与语言
2025-09-10 v2 人工智能
声音
音频与语音处理
摘要
在对话转录管道中,大语言模型(LLM)经常被用于后处理以提高语法、标点和可读性。我们探索一种互补的后处理步骤:通过添加说话人特征(如年龄、性别和情感)的元数据标签来丰富转录后的对话。其中一些标签适用于整个对话,而一些则随时间变化。我们的 метод将冻结的音频基础模型(如 Whisper 或 WavLM)与冻结的 LLAMA 语言模型耦合,以推断这些说话人属性,而无需对任一模型进行特定任务的微调。通过轻量、高效的连接器桥接音频和语言表示,我们在保持模块性和速度的同时,在说话人轮廓任务上实现了具有竞争力的性能。此外,我们演示冻结的 LLAMA 模型可以直接比较 x-vectors,在某些场景下实现 8.8% 的等错误率。
引用
@article{arxiv.2508.04795,
title = {Enhancing Dialogue Annotation with Speaker Characteristics Leveraging a Frozen LLM},
author = {Thomas Thebaud and Yen-Ju Lu and Matthew Wiesner and Peter Viechnicki and Najim Dehak},
journal= {arXiv preprint arXiv:2508.04795},
year = {2025}
}
备注
Accepted in the 2025 IEEE Automatic Speech Recognition and Understanding Workshop