中文

视觉与文本提示在 VLLMs 中用于提升情感识别

计算机视觉与模式识别 2025-07-14 v3

摘要

视觉大语言模型 (VLLM) 在多模态理解方面展现出巨大的潜力,但其在基于视频的情感识别应用仍受限于空间和情境感知不足。传统方法侧重孤立面部特征,往往忽视身体语言、环境情境及社交互动等关键非语言线索,导致在实际场景中鲁棒性下降。为填补这一空白,我们提出一种“视觉-文本提示”框架 (SoVTP),通过整合空间标注(如边界框、面部关键点)、生理信号(面部动作单元)以及情境线索(身体姿态、场景动态、他人情感)于统一提示策略中,以提升零样本情感识别能力。SoVTP 在保留整体场景信息的同时,实现对面部肌肉运动和人际互动的细粒度分析。大量实验表明,SoVTP 在提升 VLLM 视频情感识别能力方面显著优于现有视觉提示方法,证明其有效性。

关键词

引用

@article{arxiv.2504.17224,
  title  = {Visual and Textual Prompts in VLLMs for Enhancing Emotion Recognition},
  author = {Zhifeng Wang and Qixuan Zhang and Peter Zhang and Wenjia Niu and Kaihao Zhang and Ramesh Sankaranarayana and Sabrina Caldwell and Tom Gedeon},
  journal= {arXiv preprint arXiv:2504.17224},
  year   = {2025}
}

备注

Accepted by IEEE TCSVT