中文

基于多头融合Transformer的多模态动作单元检测学习

计算机视觉与模式识别 2022-03-23 v1

摘要

近年来多模态学习日益受到重视,尤其在面部分析与动作单元(AU)检测应用中,但仍存在两个主要挑战:1)用于表征的相关特征学习,以及2)多模态的高效融合。近期已有若干工作展示了利用注意力机制进行AU检测的有效性,然而其中多数将感兴趣区域(ROI)与特征绑定,却很少在各自AU的特征之间施加注意力。另一方面,采用更高效自注意力机制的Transformer已在自然语言处理与计算机视觉任务中广泛应用,但在AU检测任务中尚未被充分探索。本文提出一种新颖的端到端多头融合Transformer(MFT)方法用于AU检测,该方法通过Transformer编码器从不同模态学习AU编码特征表征,并通过另一融合Transformer模块融合模态。在融合Transformer模块中设计了多头融合注意力以实现多模态的有效融合。我们的方法在两个公开多模态AU数据库BP4D和BP4D+上进行了评估,结果优于当前最优算法与基线模型。我们进一步分析了不同模态下AU检测的性能。

关键词

引用

@article{arxiv.2203.11441,
  title  = {Multi-Modal Learning for AU Detection Based on Multi-Head Fused Transformers},
  author = {Xiang Zhang and Lijun Yin},
  journal= {arXiv preprint arXiv:2203.11441},
  year   = {2022}
}