中文

超越视觉:大型语言模型如何从价值- arousal 值解读面部表情

计算机视觉与模式识别 2025-02-12 v1 人工智能 计算与语言

摘要

大型语言模型主要通过文本输入和输出运行,但人类情感通过语言和非语言线索(包括面部表情)进行交流。虽然视觉语言模型从图像中分析面部表情,但资源密集且可能更依赖于语言先验而非视觉理解。为此,本研究探讨了LLM是否能够从面部表情的维度——价值(Valence)和 arousal(Arousal)值,这些结构化数值表示,而非使用原始视觉输入来推断情感含义。从面部表情图像中提取VA值,并以两种任务形式提供给LLM:(1)将面部表情分为基本(在IIMI数据集上)和复杂情绪(在Emotic数据集上),(2)生成面部表情的语义描述(在Emotic数据集上)。分类任务的结果表明,LLM在将VA值分类为离散情绪类别方面存在困难,尤其是对于超出基本极性(如快乐、悲伦)的情绪。然而,在语义描述任务中,LLM生成的文本描述与人类生成的解释高度一致,显示出其对面部表情的自由文本情感推断具有更强的能力。

关键词

引用

@article{arxiv.2502.06875,
  title  = {Beyond Vision: How Large Language Models Interpret Facial Expressions from Valence-Arousal Values},
  author = {Vaibhav Mehra and Guy Laban and Hatice Gunes},
  journal= {arXiv preprint arXiv:2502.06875},
  year   = {2025}
}