基于任务适应预训练的语音情感识别主动学习
声音
2024-05-02 v1 人工智能
音频与语音处理
摘要
语音情感识别(SER)因其在人机交互、虚拟助手和心理健康辅导等多个领域的广泛应用而受到日益关注。然而,现有SER方法常常忽视了预训练语音识别任务与下游SER任务之间的信息差,导致性能次优。此外,当前方法在针对每个特定语音数据集(如IEMOCAP)进行微调时需要耗费大量时间,限制了其在大规模噪声数据场景中的实际效果。为解决这些问题,本文提出一种基于主动学习(AL)的微调框架,用于SER,称为\textsc{After},该框架利用任务适应预训练(TAPT)和AL方法来提升性能和效率。具体而言,首先使用TAPT最小化预训练语音识别任务与下游语音情感识别任务之间的信息差。随后,采用AL方法迭代选择最具信息性和多样性的样本子集进行微调,从而减少计算时间。实验表明,我们的新方法\textsc{After}仅使用20%的样本即可将准确率提高8.45%,将计算时间缩短79%。进一步的\textsc{After}扩展实验及消融研究进一步确认了其有效性和在各种实际场景中的适用性。我们的源代码已在Github上提供以便复现(https://github.com/Clearloveyuan/AFTER)。
引用
@article{arxiv.2405.00307,
title = {Active Learning with Task Adaptation Pre-training for Speech Emotion Recognition},
author = {Dongyuan Li and Ying Zhang and Yusong Wang and Funakoshi Kataro and Manabu Okumura},
journal= {arXiv preprint arXiv:2405.00307},
year = {2024}
}
备注
Accepted by Journal of Natural Language Processing. arXiv admin note: text overlap with arXiv:2310.00283