面向多语言语音情感识别少样本分类的 Fixed-MAML 方法
声音
2022-06-01 v2 机器学习
音频与语音处理
摘要
在本文中,我们分析了将少样本学习应用于语音情感识别任务(SER)的可行性。当前的语音情感识别模型表现极为出色,但在输入为多语言时则会失效。此外,在训练此类模型时,仅当训练语料库规模庞大时模型性能才令人满意。当选择一种不太流行或生僻的语言时,大型训练语料库的可得性是一个重大问题。我们试图通过将这一问题转化为少样本学习问题来解决多语言性与数据匮乏的挑战。我们建议放宽 N 路 K 样本问题中所有 N 个类别均为新类别的假设,并定义一种 N+F 路问题,其中 N 和 F 分别为情感类别数与预定义固定类别数。我们提出对模型无关元学习(Model-Agnostic MetaLearning, MAML)算法进行此修改以解决问题,并将这一新模型称为 F-MAML。该改进优于原始 MAML,并在 EmoFilm 数据集上取得更好表现。
引用
@article{arxiv.2101.01356,
title = {Fixed-MAML for Few Shot Classification in Multilingual Speech Emotion Recognition},
author = {Anugunj Naman and Chetan Sinha and Liliana Mancini},
journal= {arXiv preprint arXiv:2101.01356},
year = {2022}
}
备注
Code at https://github.com/AnugunjNaman/Fixed-MAML