中文

基于晚期模态融合与规则决策的音视频复合表情识别方法

计算机视觉与模式识别 2024-04-01 v2 机器学习

摘要

本文展示了 SUN 团队在第六届 ABAW 竞赛复合表情识别挑战赛中的成果。我们提出了一种新颖的音视频复合表情识别方法。该方法依赖于在情感概率层级融合各模态的情感识别模型,而关于复合表情预测的决策则基于预定义规则。值得注意的是,我们的方法未使用任何针对目标任务特有的训练数据,因此该问题属于零样本分类任务。该方法在多语料库训练与跨语料库验证设置下进行评估。使用我们所提方法,在 C-EXPR-DB 测试子集上取得了 22.01% 的 F1 值。挑战赛中的发现表明,所提方法有望成为开发用于人类基本与复合情感音视频数据标注的智能工具的基础。

关键词

引用

@article{arxiv.2403.12687,
  title  = {Audio-Visual Compound Expression Recognition Method based on Late Modality Fusion and Rule-based Decision},
  author = {Elena Ryumina and Maxim Markitantov and Dmitry Ryumin and Heysem Kaya and Alexey Karpov},
  journal= {arXiv preprint arXiv:2403.12687},
  year   = {2024}
}

备注

7 pages, 3 figures