iMiGUE 上的多轨道多模态学习:微动作和情感识别
计算机视觉与模式识别
2025-12-30 v1
摘要
微动作识别和基于行为的情感预测都是高度具有挑战性的任务,需要主要利用视频和骨骼姿态数据来建模细微、精细的人类行为。本文提出了两个多模态框架,用于在 iMiGUE 数据集上解决这两个问题。对于微动作分类,我们探索了 RGB 和 3D 姿态基表示的互补优势,以捕捉细微的时空模式。为了全面表示手势、视频和骨骼嵌入,我们分别使用 MViTv2-S 和 2s-AGCN 提取它们。然后,通过 Cross-Modal Token Fusion 模块将它们集成,以结合空间和姿态信息。对于情感识别,我们的框架扩展到基于行为的情感预测,这是一个基于视觉线索识别情感状态的二分类任务。我们利用使用 SwinFace 和 MViTv2-S 模型提取的面部和情境嵌入,并通过设计以捕获情感表情和身体姿势的 InterFusion 模块进行融合。在 iMiGUE 数据集上进行的实验,位于 MiGA 2025 挑战的范围内,展示了我们方法在基于行为的情感预测任务中稳健的性能和准确性,其中我们的方法获得了第二名成绩。
引用
@article{arxiv.2512.23291,
title = {Multi-Track Multimodal Learning on iMiGUE: Micro-Gesture and Emotion Recognition},
author = {Arman Martirosyan and Shahane Tigranyan and Maria Razzhivina and Artak Aslanyan and Nazgul Salikhova and Ilya Makarov and Andrey Savchenko and Aram Avetisyan},
journal= {arXiv preprint arXiv:2512.23291},
year = {2025}
}