中文

基于 Transformer 的自监督多模态表征学习用于可穿戴情绪识别

人机交互 2023-04-03 v1 人工智能 声音 音频与语音处理

摘要

近年来,基于外周生理信号的可穿戴情绪识别因其侵入性较小及在真实场景中的适用性而备受关注。然而,如何有效融合多模态数据仍具挑战。此外,传统的全监督方法在标注数据有限时易过拟合。为解决上述问题,我们提出了一种新颖的用于可穿戴情绪识别的自监督学习(SSL)框架,其中通过基于时间卷积的模态特定编码器与基于 Transformer 的共享编码器实现高效多模态融合,捕获模态内与模态间相关性。大量无标注数据由五种信号变换自动赋标,所提 SSL 模型以信号变换识别为前置任务进行预训练,从而提取用于情绪相关下游任务的通用多模态表征。为评估,该 SSL 模型首先于大规模自采集生理数据集上预训练,所得编码器随后在三个公开监督情绪识别数据集上冻结或微调。最终,我们的 SSL 方法在各情绪分类任务中取得最先进结果。同时,在低数据场景下,所提模型相较全监督方法更准确且鲁棒。

关键词

引用

@article{arxiv.2303.17611,
  title  = {Transformer-based Self-supervised Multimodal Representation Learning for Wearable Emotion Recognition},
  author = {Yujin Wu and Mohamed Daoudi and Ali Amad},
  journal= {arXiv preprint arXiv:2303.17611},
  year   = {2023}
}

备注

Accepted IEEE Transactions On Affective Computing