用于鲁棒情感识别的具有混合特征重建的模态协同 Transformer
计算机视觉与模式识别
2023-12-27 v1 人工智能
摘要
作为情感计算的一个重要方面,多模态情感识别一直是多媒体社区的研究热点。尽管近期取得了进展,该领域在实际应用中仍面临两大挑战:1) 提高从未对齐的多模态特征构建联合表示的效率;2) 缓解因随机模态特征缺失导致的性能下降。本文提出了一种统一框架,即具有混合特征重建的模态协同 Transformer (MCT-HFR),以解决这些问题。MCT 的核心组件是一种新颖的基于注意力的编码器,它并发提取并动态平衡所有关联模态的模态内和模态间关系。通过额外的逐模态参数共享,可以用更少的时间和空间复杂度编码出更紧凑的表示。为了提高 MCT 的鲁棒性,我们进一步引入了由两个模块组成的 HFR:局部特征想象 (Local Feature Imagination, LFI) 和全局特征对齐 (Global Feature Alignment, GFA)。在模型训练期间,LFI 利用完整特征作为监督信号来恢复局部缺失特征,而 GFA 旨在减少成对完整和不完整表示之间的全局语义差距。在两个流行基准数据集上的实验评估表明,我们提出的方法在完整和不完整数据场景下均一致优于先进的基线方法。
引用
@article{arxiv.2312.15848,
title = {Modality-Collaborative Transformer with Hybrid Feature Reconstruction for Robust Emotion Recognition},
author = {Chengxin Chen and Pengyuan Zhang},
journal= {arXiv preprint arXiv:2312.15848},
year = {2023}
}
备注
23 pages, 9 figures, under review