集成多语言预训练模型以从语音中预测多标签回归情感占比
音频与语音处理
2023-09-21 v1 声音
信号处理
摘要
语音情感识别已从研究走向实际应用。以往从语音进行情感识别的研究集中于在 IEMOCAP 等特定数据集上开发模型。情感建模领域数据的缺乏,给在其他数据集上评估模型以及评估多语言环境下的语音情感识别模型带来了挑战。本文提出一种集成学习方法,以融合预训练模型在语音情感占比识别上的结果。所选模型用于适配来自英语和西班牙语的多语言数据。结果表明,集成学习能够提升基线单模型以及先前最优的晚期融合模型的性能。由于该任务是一个具有排序值的回归问题,性能采用斯皮尔曼秩相关系数衡量。测试集上报告的斯皮尔曼秩相关系数为 0.537,而开发集上的得分为 0.524。这些分数高于先前基于单语言数据的融合方法研究,后者在测试集和开发集上分别取得了 0.476 和 0.470 的得分。
引用
@article{arxiv.2309.11014,
title = {Ensembling Multilingual Pre-Trained Models for Predicting Multi-Label Regression Emotion Share from Speech},
author = {Bagus Tris Atmaja and Akira Sasou},
journal= {arXiv preprint arXiv:2309.11014},
year = {2023}
}
备注
4 pages, 6 tables, accepted in APSIPA-ASC 2023