融合 EEG 与语音的情感识别:面向推理阶段 EEG 数据缺失的两步联合学习框架
声音
2025-03-26 v1 人工智能
摘要
计算机接口正朝着利用多模态的方向发展,以实现更好的人机交互。自动情感识别(automatic emotion recognition, AER)能够使交互变得自然且有意义,从而提升用户体验。尽管语音是 AER 最直接、最直观的模态,但由于人类可以有意识地伪装,因此并不可靠。另一方面,像 EEG 这样的生理模态更为可靠且无法伪装。然而,由于需要专门的采集设备,EEG 在实际场景中的使用并不可行。在本文中,我们的主要目标之一是利用 EEG 模态的可靠性来促进语音模态上稳健的 AER。我们的方法在训练阶段同时使用两种模态,以便在推理时即便缺少更可靠的 EEG 模态,也能可靠地识别情感。我们提出了一种两步联合多模态学习方法(JMML),该方法同时利用模态内与模态间特征来构建情感嵌入,从而提升 AER 的性能。第一步,使用 JEC-SSL 在各单一模态上独立进行模态内学习;随后,采用我们提出的深度典型相关跨模态自编码器的扩展变体(E-DCC-CAE)进行模态间学习。该方法通过将两种模态映射到一个公共表示空间,使二者达到最大相关,从而学习它们的联合性质。这些情感嵌入同时承载两种模态的信息,进而提升 AER 中机器学习分类器的性能。实验结果证明了所提方法的有效性。据我们所知,这是首次采用联合多模态学习方法融合语音与 EEG 以实现可靠 AER 的尝试。
引用
@article{arxiv.2503.18964,
title = {Unifying EEG and Speech for Emotion Recognition: A Two-Step Joint Learning Framework for Handling Missing EEG Data During Inference},
author = {Upasana Tiwari and Rupayan Chakraborty and Sunil Kumar Kopparapu},
journal= {arXiv preprint arXiv:2503.18964},
year = {2025}
}
备注
10 pages, 5 figures