ExHuBERT:通过块扩展和在 37 个情感数据集上的微调增强 HuBERT
计算与语言
2024-06-18 v1
摘要
基础模型在语音情感识别(SER)中显示出巨大的潜力,利用预训练表示来捕捉语音信号中的情感模式。为进一步提升跨语言和跨域的 SER 性能,我们提出了一种新颖的双重方法。第一,我们收集了 EmoSet++,一个综合性的多语言、多文化语音情感语料库,包含 37 个数据集、150,907 个样本,总时长为 119.5 小时。第二,我们引入 ExHuBERT,这是一个通过 backbone 扩展和在 EmoSet++ 上微调实现的 HuBERT 增强版本。我们复制每个编码器层及其权重,然后冻结第一个副本,集成一个零初始化的线性层和 skip connections,以保留功能并确保其适用于后续微调。我们在未见数据集上的评估显示了 ExHuBERT 的有效性,为各种 SER 任务设定了新基准。模型和 EmoSet++ 详情:https://huggingface.co/amiriparian/ExHuBERT。
引用
@article{arxiv.2406.10275,
title = {ExHuBERT: Enhancing HuBERT Through Block Extension and Fine-Tuning on 37 Emotion Datasets},
author = {Shahin Amiriparian and Filip Packań and Maurice Gerczuk and Björn W. Schuller},
journal= {arXiv preprint arXiv:2406.10275},
year = {2024}
}
备注
accepted at INTERSPEECH 2024