中文

Husformer:一种用于多模态人体状态识别的多模态 Transformer

人机交互 2023-04-12 v2 机器人学

摘要

人体状态识别是人机系统中具有普遍且重要应用的关键课题。多模态融合,即来自多个数据源的指标的组合,已被证明是提高识别性能的有效方法。然而,尽管近期基于多模态的模型报告了有前景的结果,它们通常未能利用精细的融合策略来在生成融合表征时建模充分的跨模态交互;相反,当前方法依赖于冗长且不一致的数据预处理与特征构造。为应对这一局限,我们提出一种端到端的多模态 Transformer 框架用于多模态人体状态识别,称为 Husformer。具体而言,我们提出使用跨模态 Transformer,其启发某一模态通过直接关注其他模态中揭示的潜在相关性来强化自身,从而在确保充分感知所引入跨模态交互的同时融合不同模态。随后,我们利用自注意力 Transformer 进一步在融合表征中优先处理上下文信息。使用这两种注意力机制能够在融合过程中以及针对高层特征时,对多模态信号中的噪声与中断进行有效且自适应的调整。在两个人类情感语料库(DEAP 和 WESAD)以及两个认知负荷数据集(MOCAS 和 CogLoad)上的大量实验表明,在人体状态识别中,我们的 Husformer 大幅优于最先进的多模态基线以及单一模态的使用,尤其是在处理原始多模态信号时。我们还进行了消融研究以展示 Husformer 中各组件的益处。

关键词

引用

@article{arxiv.2209.15182,
  title  = {Husformer: A Multi-Modal Transformer for Multi-Modal Human State Recognition},
  author = {Ruiqi Wang and Wonse Jo and Dezhong Zhao and Weizheng Wang and Baijian Yang and Guohua Chen and Byung-Cheol Min},
  journal= {arXiv preprint arXiv:2209.15182},
  year   = {2023}
}