中文

面向视频情感估计的多模态特征提取与基于注意力的融合

计算机视觉与模式识别 2023-03-21 v1 人工智能

摘要

人机交互技术的持续改进使得情感计算成为可能。本文介绍了我们向 CVPR 2023 野外情感行为分析(ABAW)竞赛提交的工作。人机交互中的情感分析应尽可能从多维度入手,填补单一不完善的情感通道,并最终通过拟合多个结果来确定情感倾向。因此,我们利用从竞赛数据集中不同时长视频提取的多模态特征,包括音频、姿态与图像。充分知情的特征表示促使我们提出一种基于注意力的多模态框架用于情感估计。我们的系统在验证集上取得了 0.361 的性能。代码见 [https://github.com/xkwangcn/ABAW-5th-RT-IAI]。

关键词

引用

@article{arxiv.2303.10421,
  title  = {Mutilmodal Feature Extraction and Attention-based Fusion for Emotion Estimation in Videos},
  author = {Tao Shu and Xinke Wang and Ruotong Wang and Chuang Chen and Yixin Zhang and Xiao Sun},
  journal= {arXiv preprint arXiv:2303.10421},
  year   = {2023}
}

备注

5 pages, 1 figures