SeQuiFi: 通过顺序类别微调缓解语音情感识别中的灾难性遗忘
音频与语音处理
2024-10-17 v1 声音
摘要
在这项工作中,我们介绍了 SeQuiFi,一种用于缓解语音情感识别 (SER) 中灾难性遗忘 (CF) 的新方法。SeQuiFi 采用顺序类别微调策略,其中模型一次在一个情感类别上增量微调,保留并增强对每个类别的记忆。尽管已经提出了各种最先进 (SOTA) 的方法,例如基于正则化、基于记忆和基于权重平均的技术,来解决 CF,但它仍然是一个挑战,尤其是在处理多样化和多语言数据集时。通过大量实验,我们证明 SeQuiFi 在多个基准 SER 数据集(包括 CREMA-D、RAVDESS、Emo-DB、MESD 和 SHEMO,涵盖不同语言)上的准确率和 F1 分数方面,显著优于普通微调和 SOTA 持续学习技术。
引用
@article{arxiv.2410.12567,
title = {SeQuiFi: Mitigating Catastrophic Forgetting in Speech Emotion Recognition with Sequential Class-Finetuning},
author = {Sarthak Jain and Orchid Chetia Phukan and Swarup Ranjan Behera and Arun Balaji Buduru and Rajesh Sharma},
journal= {arXiv preprint arXiv:2410.12567},
year = {2024}
}