结合发声激励信息与发音运动学的语音情感识别
声音
2025-11-12 v1 机器学习
摘要
得益于深度学习方法,语音情感识别(SER)取得了显著进展,而文本信息进一步提升了其性能。然而,很少有研究关注语音产生过程中的生理信息,这些信息同样包含说话人特征,包括情感状态。为了弥补这一空白,我们进行了一系列实验,以探讨发声激励信息和发音运动学在 SER 中的潜力。由于用于此目的的训练数据稀缺,我们引入了一个表演情感数据集 STEM-E2VA,其中包含音频以及电声门图(EGG)和电磁发音仪(EMA)等生理数据。EGG 和 EMA 分别提供发声激励和发音运动学信息。此外,我们没有使用采集到的 EGG 和 EMA,而是使用通过语音反演方法估计出的生理数据来进行情感识别,以探索将此类生理信息应用于真实 SER 的可行性。实验结果证实了纳入语音产生生理信息对 SER 的有效性,并展示了其在真实场景中实际应用的潜力。
引用
@article{arxiv.2511.07955,
title = {Speech Emotion Recognition with Phonation Excitation Information and Articulatory Kinematics},
author = {Ziqian Zhang and Min Huang and Zhongzhe Xiao},
journal= {arXiv preprint arXiv:2511.07955},
year = {2025}
}