Omni-Emotion:扩展面向多模态情感分析的视频多模态大语言模型
计算机视觉与模式识别
2025-01-17 v1
摘要
准确理解情感对于诸如人机交互等领域至关重要。由于情感的复杂性及其多模态特性(例如情感受到面部表情和音频的影响),研究者们转向使用多模态模型来理解人类情感而非单一模态。然而,当前的视频多模态大语言模型 (MLLM) 在有效整合音频和识别细微面部微表情方面存在困难。此外,缺乏详细的情感分析数据集也限制了多模态情感分析的发展。为此,我们引入了一套自评数据集和一套人工评审数据集,分别包含 24,137 个粗粒度样本和 3,500 个带有详细情感标注的手动标注样本。这些数据集使模型能够从多样化场景中学习,并更好地泛化到实际应用。此外,除了音频建模,我们提出将面部编码模型显式集成到现有的先进视频 MLLM 中,使其能够有效地统一音频和细微的面部线索进行情感理解。通过在我们提出的数据集中对这些特征进行统一空间对齐并进行指令调优,Omni-Emotion 在情感识别和推理任务中实现了最佳性能。
引用
@article{arxiv.2501.09502,
title = {Omni-Emotion: Extending Video MLLM with Detailed Face and Audio Modeling for Multimodal Emotion Analysis},
author = {Qize Yang and Detao Bai and Yi-Xing Peng and Xihan Wei},
journal= {arXiv preprint arXiv:2501.09502},
year = {2025}
}