MicroEmo:基于视频对话中微表情动态的时间敏感多模态情感识别
计算机视觉与模式识别
2024-07-25 v2 多媒体
摘要
多模态大语言模型(MLLM)在情感识别方面展现了卓越的多模态情感识别能力,整合视觉、声学和语言上下文中的多模态线索来识别人类情绪状态。然而,现有方法忽略了捕捉微表情局部 facial features 的时间动态,以及未利用话语感知视频片段的上下文依赖性,限制了其实际效果。本文提出 MicroEmo,一个面向聚焦局部 facial micro-expression 动态和话语感知视频片段上下文依赖性的时间敏感 MLLM。我们的模型包含两个关键架构贡献:(1)全局-局部注意力视觉编码器,将全局帧级时间戳绑定的图像特征与微表情局部 facial features 的时间动态相集成;(2)话语感知视频 Q-Former,通过为每个话语片段和整个视频生成视觉 token 序列并将其组合,捕捉多尺度和上下文依赖性。初步的定性实验表明,在一个新建构的可解释多模态情感识别(EMER)任务中,该任务利用多模态和多方位线索以开放词汇(OV)方式预测情绪,MicroEmo 在最新方法中展现出有效性。
引用
@article{arxiv.2407.16552,
title = {MicroEmo: Time-Sensitive Multimodal Emotion Recognition with Micro-Expression Dynamics in Video Dialogues},
author = {Liyun Zhang},
journal= {arXiv preprint arXiv:2407.16552},
year = {2024}
}