通过可微架构搜索增强语音情感识别
声音
2024-01-22 v3 机器学习
音频与语音处理
摘要
语音情感识别(SER)是人机交互中情感感知通信的关键赋能技术。深度学习(DL)的最新进展通过增加模型复杂度显著提升了 SER 模型的性能。然而,设计最优的 DL 架构需要先验经验和实验评估。令人鼓舞的是,神经架构搜索(NAS)为自动确定最优 DL 模型提供了有前景的途径。特别地,可微架构搜索(DARTS)是一种利用 NAS 搜索优化模型的高效方法。本文提出了一种 DARTS 优化的 CNN 与 LSTM 联合架构,以提升 SER 性能,其中文献指导了 CNN 和 LSTM 耦合的选择以提供改进的性能。虽然 DARTS 此前已应用于 CNN 和 LSTM 组合,我们的方法引入了一种新机制,特别是在使用 DARTS 选择 CNN 操作方面。与以往研究不同,我们不约束 DARTS 单元内 CNN 层的顺序,而是让 DARTS 自主决定最优层顺序。在 IEMOCAP 和 MSP-IMPROV 数据集上实验表明,我们提出的方法比手工设计 CNN-LSTM 配置实现了显著更高的 SER 准确率,并且优于使用 DARTS 于 CNN-LSTM 上报告的最佳 SER 结果。
引用
@article{arxiv.2305.14402,
title = {Enhancing Speech Emotion Recognition Through Differentiable Architecture Search},
author = {Thejan Rajapakshe and Rajib Rana and Sara Khalifa and Berrak Sisman and Björn Schuller},
journal= {arXiv preprint arXiv:2305.14402},
year = {2024}
}
备注
5 pages, 4 figures