中文

面向语音情感识别的神经架构搜索

声音 2022-04-01 v1 计算与语言 机器学习 音频与语音处理

摘要

深度神经网络为语音情感识别(SER)带来了显著进展。然而,SER 中的架构设计主要基于专家知识与经验性(试错)评估,耗时且耗费资源。本文提出应用神经架构搜索(NAS)技术自动配置 SER 模型。为加速候选架构优化,我们提出一种均匀路径丢弃策略,以促使所有候选架构操作被均等优化。在 IEMOCAP 上两种不同神经结构的实验结果表明,NAS 可在保持模型参数规模的同时提升 SER 性能(54.89% 至 56.28%)。所提丢弃策略也展现出优于先前方法的性能。

关键词

引用

@article{arxiv.2203.16928,
  title  = {Neural Architecture Search for Speech Emotion Recognition},
  author = {Xixin Wu and Shoukang Hu and Zhiyong Wu and Xunying Liu and Helen Meng},
  journal= {arXiv preprint arXiv:2203.16928},
  year   = {2022}
}

备注

Accepted by ICASSP 2022