语音感知大语言模型的说话人验证:评估与增强
声音
2026-03-12 v1 人工智能
摘要
语音感知大语言模型 (speech-aware LLMs) 能够接受语音输入,但其训练目标主要侧重于语言内容或特定领域如情绪或说话人性别,导致其是否编码说话人身份尚不清晰。首先,我们提出一种模型无关的评分协议,通过利用 Yes/No 标记概率的置信度或对数似然比,为 API-only 和开放权重模型产生连续的验证得分。使用该协议,我们对最近的语音感知 LLMs 进行基准测试,观察到其说话人区分能力较弱(在 VoxCeleb1 上 EER 超过 20%)。其次,我们引入一种轻量级增强方法,通过注入冻结的 ECAPA-TDNN 说话人嵌入并配合学习的投影,仅训练 LoRA 适配器,即可为 LLM 增添说话人验证功能。在 TinyLLaMA-1.1B 上,得到的 ECAPA-LLM 在 VoxCeleb1-E 上实现 1.03% 的 EER,接近专用的说话人验证系统,同时保持自然语言界面。
引用
@article{arxiv.2603.10827,
title = {Speaker Verification with Speech-Aware LLMs: Evaluation and Augmentation},
author = {Thomas Thebaud and Yuzhe Wang and Laureano Moro-Velazquez and Jesus Villalba-Lopez and Najim Dehak},
journal= {arXiv preprint arXiv:2603.10827},
year = {2026}
}
备注
3 Tables, 1 Figure, Under review