用于语音情感识别、说话人验证与口语理解的微调 Wav2vec 2.0/HuBERT 基准
计算与语言
2022-10-05 v3 神经与进化计算
声音
音频与语音处理
摘要
诸如 wav2vec 2.0 和 HuBERT 等语音自监督模型在自动语音识别 (ASR) 领域正取得革命性进展。然而,尚未完全证明它们在 ASR 以外的任务上能产生更好的性能。在本工作中,我们针对三个非 ASR 语音任务:语音情感识别、说话人验证和口语理解,探索了 wav2vec 2.0 和 HuBERT 预训练模型的部分微调与全面微调。通过提出的简单下游框架,在 IEMOCAP 的语音情感识别任务中,最佳得分在说话人相关设定下达到了 79.58% 的加权准确率,在说话人无关设定下达到了 73.01% 的加权准确率;在 VoxCeleb1 的说话人验证任务中,等错误率为 2.36%;在 SLURP 的意图分类任务中准确率为 89.38%,槽位填充任务的 F1 值为 78.92%,展示了微调后的 wav2vec 2.0 和 HuBERT 在学习韵律、声纹和语义表示方面的优势。
引用
@article{arxiv.2111.02735,
title = {A Fine-tuned Wav2vec 2.0/HuBERT Benchmark For Speech Emotion Recognition, Speaker Verification and Spoken Language Understanding},
author = {Yingzhi Wang and Abdelmoumene Boumadane and Abdelwahab Heba},
journal= {arXiv preprint arXiv:2111.02735},
year = {2022}
}
备注
7 pages, 2 figures