面向阿拉伯语语音情感识别的混合 CNN-Transformer 架构
计算与语言
2026-04-10 v1 人工智能
声音
摘要
使用机器学习从语音中识别情感已成为活跃的研究领域 due to its importance in building human-centered applications。然而,尽管已在英语、德语及其他欧洲和亚洲语言上开展了许多研究,但阿拉伯语的研究仍稀缺 due to the limited availability of annotated datasets。本文提出一种基于混合 CNN-Transformer 架构的阿拉伯语语音情感识别(SER)系统。该模型利用卷积层从 Mel 频谱图输入中提取判别性特征,并利用 Transformer 编码器捕获语音中长程时序依赖关系。在EYASE(埃及阿拉伯语语音情感)语料库上进行实验,所提出的模型达到了97.8%的准确率和0.98的宏平均F1分数。这些结果表明,结合卷积特征提取与注意力建模在阿拉伯语SER方面具有有效性,并凸显了基于Transformer的方法在资源匮乏语言中的潜力。
引用
@article{arxiv.2604.07357,
title = {Hybrid CNN-Transformer Architecture for Arabic Speech Emotion Recognition},
author = {Youcef Soufiane Gheffari and Oussama Mustapha Benouddane and Samiya Silarbi},
journal= {arXiv preprint arXiv:2604.07357},
year = {2026}
}
备注
7 pages, 4 figures. Master's thesis work, University of Science and Technology of Oran - Mohamed Boudiaf (USTO-MB)