中文

利用视觉提示增强大语言模型中的情感识别

计算机视觉与模式识别 2024-10-04 v1

摘要

视觉大语言模型(VLLMs)正在改变计算机视觉和自然语言处理的交叉领域。然而,在这些模型中使用视觉提示进行情感识别的潜力仍然基本未被探索和利用。传统的VLLM方法在空间局部分析方面困难,常常丢弃有价值的全局上下文。为解决此问题,我们提出了一种“集合-视觉”提示(Set-of-Vision prompting, SoV)方法,通过利用边界框和面部关键点等空间信息精准标记目标,从而增强零样本情感识别。SoV在保持丰富图像上下文的同时,提高了人脸计数和情感分类的准确性。通过一系列实验和对近期商业或开源VLLMs的分析,我们评估了SoV模型在自然环境中理解面部表情的能力。我们的发现表明,将空间视觉提示集成到VLLMs中以提高情感识别性能是有效的。

关键词

引用

@article{arxiv.2410.02244,
  title  = {Visual Prompting in LLMs for Enhancing Emotion Recognition},
  author = {Qixuan Zhang and Zhifeng Wang and Dylan Zhang and Wenjia Niu and Sabrina Caldwell and Tom Gedeon and Yang Liu and Zhenyue Qin},
  journal= {arXiv preprint arXiv:2410.02244},
  year   = {2024}
}

备注

Accepted by EMNLP2024 (Main, Long paper)