基于分段式 MLLM 框架的细粒度情感识别:利用 Qwen3-Omni 进行情感歧义与犹豫检测
计算机视觉与模式识别
2026-03-24 v2 人工智能
摘要
视频情感识别是情感计算中的关键任务,识别细微心理状态如情感矛盾(Ambivalence)和犹豫(Hesitancy)对行为干预和数字健康具有重要价值。情感矛盾和犹豫状态常通过跨模态不一致性表现出来,例如面部表情、语音语调与文本语义之间的差异,这对自动识别提出了巨大挑战。本文提出一种识别框架,将时序分段建模与多模态大语言模型相结合。为解决长视频处理中的计算效率和 token 限制问题,我们采用分段策略,将视频划分为最多持续 5 秒的短片段。我们采用 Qwen3-Omni-30B-A3B 模型,通过 MS-Swift 框架使用 LoRA 和全参数策略在 BAH 数据集上进行微调,使模型能够协同分析视觉和听觉信号。实验结果表明,所提方法在测试集上实现了 85.1% 的准确率,显著优于现有基准,验证了多模态大语言模型在捕获复杂细粒度情感冲突方面的卓越能力。代码已发布于 https://github.com/dlnn123/A-H-Detection-with-Qwen-Omni.git。
引用
@article{arxiv.2603.13406,
title = {Nuanced Emotion Recognition Based on a Segment-based MLLM Framework Leveraging Qwen3-Omni for AH Detection},
author = {Liang Tang and Hongda Li and Jiayu Zhang and Long Chen and Shuxian Li and Siqi Pei and Tiaonan Duan and Yuhao Cheng},
journal= {arXiv preprint arXiv:2603.13406},
year = {2026}
}
备注
5 pages, 1 figures