中文

双重收获:解耦主体-上下文 Transformer 的单阶段情感识别

计算机视觉与模式识别 2024-04-30 v2

摘要

情感识别旨在辨别图像中主体的情感状态,依赖于主体中心和上下文视觉线索。当前方法通常遵循两个阶段的管道:首先通过离散检测器局部化主体,然后通过主体和上下文特征的晚期融合进行情感分类。然而,这种复杂的范式存在训练阶段的割裂以及细粒度主体-上下文元素之间相互作用有限的问题。为此,我们提出一种单阶段情感识别方法,采用解耦主体-上下文 Transformer(DSCT),实现主体局部化和情感分类的同步。与对训练阶段进行 compartmentalization(功能划分)不同,我们联合利用框和情感信号作为监督,以丰富主体中心的特征学习。进一步,我们引入 DSCT 以解耦-融合的方式促进细粒度主体-上下文线索之间的相互作用。在 DSCT 中,解耦的查询 token——主体查询和上下文查询——在各层中逐渐交织,其中利用和聚合了空间关系和语义关系。我们在两个广泛使用的上下文感知情感识别数据集 CAER-S 和 EMOTIC 上评估了我们的单阶段框架。我们的做法优于两个阶段的替代方案,参数更少,在 CAER-S 和 EMOTIC 数据集上分别实现了 3.39% 的准确率提升和 6.46% 的平均精度提升。

关键词

引用

@article{arxiv.2404.17205,
  title  = {Two in One Go: Single-stage Emotion Recognition with Decoupled Subject-context Transformer},
  author = {Xinpeng Li and Teng Wang and Jian Zhao and Shuyi Mao and Jinbao Wang and Feng Zheng and Xiaojiang Peng and Xuelong Li},
  journal= {arXiv preprint arXiv:2404.17205},
  year   = {2024}
}