评估 Wav2Vec 2.0、XLS-R 和 Whisper 中 Transformer 层在说话人识别任务中的有效性
声音
2025-09-30 v2 人工智能
计算与语言
机器学习
音频与语音处理
摘要
本研究评估了三种先进语音编码器模型(Wav2Vec 2.0、XLS-R 和 Whisper)在说话人识别任务中的性能。通过微调这些模型并使用 SVCCA、k-means 聚类和 t-SNE 可视化分析它们的逐层表示,我们发现 Wav2Vec 2.0 和 XLS-R 在其早期层中有效地捕获了说话人特定特征,且微调提高了稳定性和性能。Whisper 在更深层中表现出更好的性能。此外,我们确定了在针对说话人识别任务进行微调时每个模型的最优 Transformer 层数。
引用
@article{arxiv.2509.00230,
title = {Evaluating the Effectiveness of Transformer Layers in Wav2Vec 2.0, XLS-R, and Whisper for Speaker Identification Tasks},
author = {Linus Stuhlmann and Michael Alexander Saxer},
journal= {arXiv preprint arXiv:2509.00230},
year = {2025}
}
备注
This was a conducted student project at our univerity, we don't think this fulfills the requirements for a publication on arxiv