中文

利用预训练声学嵌入联合预测情感、年龄与国家

音频与语音处理 2022-09-28 v1

摘要

在本文中,我们展示了使用预训练模型提取声学嵌入以联合预测(多任务学习)三项任务:情感、年龄与母语国家。该预训练模型使用 wav2vec 2.0 large robust 模型在语音情感语料库上训练。情感与年龄任务为回归问题,而国家预测为分类任务。采用三个指标的单调和平均值来评估多任务学习的性能。分类器为具有两个独立层与共享层(包括输出层)的线性网络。本研究探索了针对不同声学特征(包括从情感语音数据集上训练的模型提取的声学嵌入)、随机种子数、批大小与归一化的多任务学习,以从语音中预测副语言信息。

关键词

引用

@article{arxiv.2207.10333,
  title  = {Jointly Predicting Emotion, Age, and Country Using Pre-Trained Acoustic Embedding},
  author = {Bagus Tris Atmaja and Zanjabila and Akira Sasou},
  journal= {arXiv preprint arXiv:2207.10333},
  year   = {2022}
}