中文

面向说话人感知的自训练语音基础模型——DELULU

声音 2026-03-26 v2 计算与语言

摘要

自监督语音模型在内容驱动任务上已取得显著成功,但在捕获说话人判别特征方面仍有限,这对于验证、说话人分割和描绘应用至关重要。我们引入 DELULU,一个面向说话人感知的自训练基础模型,通过纳入说话人信息结构来解决这一限制。DELULU 利用来自 ReDimNet 的帧级嵌入指导 k 均值聚类,以生成伪标签,引入说话人判别归纳偏置,将表示学习与说话人身份对齐。DELULU 在广泛的说话人任务上显著优于先前的自监督模型,在说话人验证等错误率(EER)上实现最高可达 62% 的相对提升,并在零样本描绘任务中持续获得提升,包括性别、年龄、方言和说话人计数; notably even 超过其教师模型在零样本评估中。我们的发现表明,DELULU 是说话人感知语音处理的强大通用编码器,无需任务特定的微调即可实现卓越的性能。

关键词

引用

@article{arxiv.2510.17662,
  title  = {DELULU: Discriminative Embedding Learning Using Latent Units for Speaker-Aware Self-Trained Speech Foundational Model},
  author = {Massa Baali and Rita Singh and Bhiksha Raj},
  journal= {arXiv preprint arXiv:2510.17662},
  year   = {2026}
}