中文

基于独立预训练模型的文本相关声纹识别内存高效训练

音频与语音处理 2026-01-13 v2 计算与语言 机器学习

摘要

本文介绍了我们提交给 2024 年文本相关声纹识别挑战赛(TdSV)伊朗赛区的系统。传统的 TdSV 方法通常联合建模说话人和语言特征,训练时需要未分段的输入,计算成本高昂。此外,这些方法往往在目标域数据集上微调大规模预训练说话人嵌入模型,这可能会损害预训练模型原本捕捉说话人特异性特征的能力。为克服这些局限,我们采用了一种独立利用两个预训练模型的 TdSV 系统,并证明通过针对性的域自适应利用预训练模型,可以在避免传统方法中联合微调未分段输入所带来的巨大计算成本的同时,取得有竞争力的结果。我们的最佳系统在评估子集上达到了 0.0358 的 MinDCF,并在挑战赛中获得第一名。

关键词

引用

@article{arxiv.2411.10828,
  title  = {Memory-Efficient Training for Text-Dependent SV with Independent Pre-trained Models},
  author = {Seyed Ali Farokh and Hossein Zeinali},
  journal= {arXiv preprint arXiv:2411.10828},
  year   = {2026}
}

备注

Accepted at ROCLING 2025