端到端语义中心化的视频多模态情感计算
计算机视觉与模式识别
2024-08-15 v1 人工智能
机器学习
多媒体
摘要
在通向通用人工智能(AGI)的道路上,理解人类情感对于增强机器认知能力至关重要。为了实现更自然的人机交互,基于人类语音视频的多模态情感计算(MAC)引起了越来越多的关注。然而,此前的方法主要致力于设计多模态融合算法,面临两个问题:由不同的预处理操作引起的语义不平衡,以及不同模态中包含的情感内容与多模态真实标签不一致所导致的语义不匹配。此外,手动特征提取器的使用使得它们无法为多个MAC下游任务构建端到端流水线。为应对上述挑战,我们提出了一种名为SemanticMAC的新型端到端框架,用于计算人类语音视频中的多模态语义中心化情感。我们首先在多模态数据预处理中采用预训练的Transformer模型,并设计情感感知器(Affective Perceiver)模块来捕获单模态情感信息。此外,我们提出了一种语义中心化的方法,通过三种方式统一多模态表示学习,包括门控特征交互、多任务伪标签生成以及样本内/样本间对比学习。最后,SemanticMAC在语义中心化标签的指导下有效学习特定语义和共享语义表示。大量实验结果表明,我们的方法在四个MAC下游任务的七个公开数据集上超越了最先进的方法。
引用
@article{arxiv.2408.07694,
title = {End-to-end Semantic-centric Video-based Multimodal Affective Computing},
author = {Ronghao Lin and Ying Zeng and Sijie Mai and Haifeng Hu},
journal= {arXiv preprint arXiv:2408.07694},
year = {2024}
}
备注
Under Review