中文

EmotionNAS:用于语音情感识别的双流神经架构搜索

音频与语音处理 2023-06-12 v2 机器学习 声音

摘要

语音情感识别(SER)是人机交互中的重要研究课题。现有工作主要依赖人类专业知识设计模型。尽管取得成功,不同数据集常需要不同结构与超参数。为每个数据集搜索最优模型耗时耗力。为解决此问题,我们提出一种基于双流神经架构搜索(NAS)的框架,称为“EmotionNAS”。具体地,我们以双流特征(即手工特征与深度特征)作为输入,随后通过 NAS 为每流搜索最优结构。此外,我们通过高效信息补充模块融合不同流中的互补信息。实验结果证明,我们的方法优于现有手工设计与基于 NAS 的模型,刷新了最优(SOTA)记录。

关键词

引用

@article{arxiv.2203.13617,
  title  = {EmotionNAS: Two-stream Neural Architecture Search for Speech Emotion Recognition},
  author = {Haiyang Sun and Zheng Lian and Bin Liu and Ying Li and Licai Sun and Cong Cai and Jianhua Tao and Meng Wang and Yuan Cheng},
  journal= {arXiv preprint arXiv:2203.13617},
  year   = {2023}
}

备注

Accepted to Interspeech 2023