SpeakerLLM:面向说话人理解与验证推理的说话人专用音频大语言模型
声音
2026-05-15 v1 人工智能
机器学习
多媒体
音频与语音处理
摘要
随着面向物理 AI、对话式机器人和无屏幕可穿戴设备的音频优先型智能体日益增多,音频大语言模型(audio-LLMs)必须集成说话人特定的理解能力,以支持用户授权、个性化和情境感知交互。这需要建模说话人是谁、语音听起来如何,以及录音条件如何影响说话人线索。传统的说话人验证系统提供强大的标量评分,但缺乏语言证据;而当前的音频-LLM 和说话人感知语言模型在组织说话人信息方面的能力有限,只能处理二元标签或描述性轮廓。我们提出SpeakerLLM,一个说话人专用音频-LLM 框架,将单句说话人轮廓、录音条件理解、句子对说话人比较以及以证据组织的验证推理统一集成于自然语言界面中。我们构建验证推理目标和决策组合策略,将轮廓级别证据与最终的相同或不同决策分离,并将录音条件、轮廓证据和决策组织成结构化轨迹。在SpeakerLLM核心,采用层次化说话人标记器来捕获多尺度的说话人证据。句子级别的说话人嵌入总结身份和轮廓级别线索,而帧级别的说话人特征保留细粒度的声学描述。实验表明,SpeakerLLM-Base 在说话人轮廓和录音条件理解方面优于通用音频-LLM,而SpeakerLLM-VR 保持强大的生成裁决准确性,并产生以监督验证推理模式为依据的决策轨迹。我们将发布数据丰富的监督数据集和目标构建代码,以便可重复性。
引用
@article{arxiv.2605.15044,
title = {SpeakerLLM: A Speaker-Specialized Audio-LLM for Speaker Understanding and Verification Reasoning},
author = {KiHyun Nam and Jungwoo Heo and Siu Bae and Ha-Jin Yu and Joon Son Chung},
journal= {arXiv preprint arXiv:2605.15044},
year = {2026}
}