中文

评估 Wav2Vec 2.0、XLS-R 和 Whisper 中 Transformer 层在说话人识别任务中的有效性

声音 2025-09-30 v2 人工智能 计算与语言 机器学习 音频与语音处理

摘要

本研究评估了三种先进语音编码器模型(Wav2Vec 2.0、XLS-R 和 Whisper)在说话人识别任务中的性能。通过微调这些模型并使用 SVCCA、k-means 聚类和 t-SNE 可视化分析它们的逐层表示,我们发现 Wav2Vec 2.0 和 XLS-R 在其早期层中有效地捕获了说话人特定特征,且微调提高了稳定性和性能。Whisper 在更深层中表现出更好的性能。此外,我们确定了在针对说话人识别任务进行微调时每个模型的最优 Transformer 层数。

关键词

引用

@article{arxiv.2509.00230,
  title  = {Evaluating the Effectiveness of Transformer Layers in Wav2Vec 2.0, XLS-R, and Whisper for Speaker Identification Tasks},
  author = {Linus Stuhlmann and Michael Alexander Saxer},
  journal= {arXiv preprint arXiv:2509.00230},
  year   = {2025}
}

备注

This was a conducted student project at our univerity, we don't think this fulfills the requirements for a publication on arxiv