EmotionNAS:用于语音情感识别的双流神经架构搜索
音频与语音处理
2023-06-12 v2 机器学习
声音
摘要
语音情感识别(SER)是人机交互中的重要研究课题。现有工作主要依赖人类专业知识设计模型。尽管取得成功,不同数据集常需要不同结构与超参数。为每个数据集搜索最优模型耗时耗力。为解决此问题,我们提出一种基于双流神经架构搜索(NAS)的框架,称为“EmotionNAS”。具体地,我们以双流特征(即手工特征与深度特征)作为输入,随后通过 NAS 为每流搜索最优结构。此外,我们通过高效信息补充模块融合不同流中的互补信息。实验结果证明,我们的方法优于现有手工设计与基于 NAS 的模型,刷新了最优(SOTA)记录。
引用
@article{arxiv.2203.13617,
title = {EmotionNAS: Two-stream Neural Architecture Search for Speech Emotion Recognition},
author = {Haiyang Sun and Zheng Lian and Bin Liu and Ying Li and Licai Sun and Cong Cai and Jianhua Tao and Meng Wang and Yuan Cheng},
journal= {arXiv preprint arXiv:2203.13617},
year = {2023}
}
备注
Accepted to Interspeech 2023