利用预训练声学嵌入联合预测情感、年龄与国家
音频与语音处理
2022-09-28 v1
摘要
在本文中,我们展示了使用预训练模型提取声学嵌入以联合预测(多任务学习)三项任务:情感、年龄与母语国家。该预训练模型使用 wav2vec 2.0 large robust 模型在语音情感语料库上训练。情感与年龄任务为回归问题,而国家预测为分类任务。采用三个指标的单调和平均值来评估多任务学习的性能。分类器为具有两个独立层与共享层(包括输出层)的线性网络。本研究探索了针对不同声学特征(包括从情感语音数据集上训练的模型提取的声学嵌入)、随机种子数、批大小与归一化的多任务学习,以从语音中预测副语言信息。
引用
@article{arxiv.2207.10333,
title = {Jointly Predicting Emotion, Age, and Country Using Pre-Trained Acoustic Embedding},
author = {Bagus Tris Atmaja and Zanjabila and Akira Sasou},
journal= {arXiv preprint arXiv:2207.10333},
year = {2022}
}