中文

大型视觉语言模型作为情境感知中的情感识别器

计算机视觉与模式识别 2024-07-17 v1 人工智能

摘要

情境感知情感识别 (CAER) 是一个复杂且重要的任务,需要从各种情境线索中进行情感感知。以往方法主要专注于设计复杂的体系结构来从图像中提取情感线索。然而,这些方法的知识局限于特定的训练数据集,可能反映出标注者的主观情感偏见。此外,在实际应用中获取大量标记数据常常具有挑战性。本文系统地探索了利用大型视觉语言模型 (LVLMs) 来赋能 CAER 任务的潜力,具体从三个范式进行:1) 我们在两个 CAER 数据集上微调 LVLMs,这是将大型模型迁移到下游任务最常见的方式。2) 我们设计零样本和少样本模式来评估 LVLMs 在数据有限甚至完全未见情境下的性能。在这种情况下,提出了一个无训练框架,以充分利用 LVLMs 的情境学习 (ICL) 能力。具体而言,我们开发了一种基于图像相似性的排序算法来检索示例;随后,将指令、检索到的示例和测试示例组合输入 LVLMs 以获得相应的情感判断。3) 为了利用 LVLMs 的丰富知识库,我们将链式思考 (CoT) 纳入我们的框架以增强模型的推理能力并提供可解释的结果。广泛的实验和分析表明,LVLMs 在不同范式下在 CAER 任务中实现了具竞争力的性能。值得注意的是,少样本设置下的卓越表现表明 LVLMs 能够在不进行大量训练的情况下完成特定任务。

关键词

引用

@article{arxiv.2407.11300,
  title  = {Large Vision-Language Models as Emotion Recognizers in Context Awareness},
  author = {Yuxuan Lei and Dingkang Yang and Zhaoyu Chen and Jiawei Chen and Peng Zhai and Lihua Zhang},
  journal= {arXiv preprint arXiv:2407.11300},
  year   = {2024}
}