情感-Qwen:面向情感与视觉理解的统一框架
多媒体
2025-08-14 v3 计算机视觉与模式识别
摘要
准确地理解视频中的情感,需有效地通过整合视觉、文本、听觉和情境线索来识别和解释情感状态。尽管近期的大型多模态模型(LMM)在通用视觉语言(VL)任务中取得了显著进展,但其在情感特定场景下的性能常常下降,在针对情感任务的微调过程中会出现灾难性遗忘。为克服这些限制,我们提出了情感-Qwen(Emotion-Qwen),一个统一的多模态框架,旨在同时实现稳健的情感理解并保留通用VL推理能力。情感-Qwen 引入了基于混合专家(Mixture-of-Experts, MoE)架构的 novel Hybrid Compressor,通过动态路由输入,在情感特定处理和通用多模态推理之间实现最优平衡。我们进一步提出了 meticulously结构化的三阶段预训练流程,利用广泛的通用数据和情感专注数据来增强多模态表征的鲁棒性和模型的适应性。此外,我们开发了 Video Emotion Reasoning(VER)数据集,一个包含超过 4 万个视频剪辑,标注了详细的情境感知情感描述的大规模双语资源,显著促进了细粒度情感推理的研究。大量实验表明,情感-Qwen 在多个情感识别和推理基准测试中实现了最先进的性能,同时在通用VL任务中保持高度具竞争力的成绩。
引用
@article{arxiv.2505.06685,
title = {Emotion-Qwen: A Unified Framework for Emotion and Vision Understanding},
author = {Dawei Huang and Qing Li and Chuan Yan and Zebang Cheng and Zihao Han and Yurong Huang and Xiang Li and Bin Li and Xiaohui Wang and Zheng Lian and Zhi-Qi Cheng and Xiaojiang Peng},
journal= {arXiv preprint arXiv:2505.06685},
year = {2025}
}