中文

基于跨模态翻译与对齐的跨模态知识迁移用于情感识别

图像与视频处理 2021-08-03 v1

摘要

多模态情感识别模型利用不同模态中的互补信息以超越其单模态对应模型。然而,由于特定模态传感器或数据的不可用,多模态模型未必总能使用。为此,我们旨在通过训练期间将知识从性能更好(或更强)的模态迁移到较弱模态,来提升单模态情感识别模型的性能。我们提出的用于跨模态知识迁移的多模态训练框架依赖两个主要步骤。首先,编码器-分类器模型为较强模态创建任务特定表示。然后,跨模态翻译生成多模态中间表示,这些表示还在潜空间与较强模态表示对齐。为利用时序序列情感数据中的上下文信息,我们使用 Bi-GRU 和 transformer 编码器。我们在两个多模态情感数据集上验证我们的方法,即用于二分类情感分类的 CMU-MOSI 和用于维度情感回归的 RECOLA。结果表明,所提方法持续提升了较弱模态的单模态测试时性能。

关键词

引用

@article{arxiv.2108.00809,
  title  = {Cross-Modal Knowledge Transfer via Inter-Modal Translation and Alignment for Affect Recognition},
  author = {Vandana Rajan and Alessio Brutti and Andrea Cavallaro},
  journal= {arXiv preprint arXiv:2108.00809},
  year   = {2021}
}

备注

Under review