中文

音频大语言模型能否验证说话人身份?

声音 2025-09-25 v1 音频与语音处理

摘要

本文研究了将音频大语言模型(ALLM)应用于说话人验证(SV)的问题。我们将SV重新表述为音频问答任务,并在公开基准上进行了全面的零样本评估,结果表明当前ALLM的零样本SV能力有限,且在多样化声学条件下常常表现不佳。为应对这一挑战,我们对说话人验证数据进行了监督微调,并提出了一种基于规则的难样本对构建策略以生成更具挑战性的训练对。轻量级微调显著提升了性能,但ALLM与传统模型之间仍存在差距。随后,我们将研究扩展至文本相关的SV,通过联合查询ALLM来验证说话人身份和语音内容,获得了与级联ASR-SV系统相当的结果。我们的发现表明,通过适当的适配,ALLM有潜力作为鲁棒说话人验证系统的统一模型,同时保持其通用音频理解能力。

关键词

引用

@article{arxiv.2509.19755,
  title  = {Can Audio Large Language Models Verify Speaker Identity?},
  author = {Yiming Ren and Xuenan Xu and Baoxiang Li and Shuai Wang and Chao Zhang},
  journal= {arXiv preprint arXiv:2509.19755},
  year   = {2025}
}