中文

基于图像描述文本的上下文情绪估计

计算机视觉与模式识别 2023-09-26 v1 人工智能

摘要

图像中的情绪估计是一项具有挑战性的任务,通常利用计算机视觉方法,通过人脸、身体姿态和上下文线索直接估计人的情绪。在本文中,我们探索大型语言模型(LLMs)是否能够通过先对图像生成描述文本,再使用 LLM 进行推理,来辅助上下文情绪估计任务。首先,我们必须理解:LLM 对人类情绪的感知能力如何?哪些信息部分使它们能够判定情绪?一个初始挑战是构建一幅描述场景中人物且包含与情绪感知相关信息的描述文本。为此,我们提出了一组针对人脸、身体、交互和环境的自然语言描述符。我们使用它们为 EMOTIC 数据集中的 331 张图像子集手动生成描述文本和情绪标注。这些描述文本为情绪估计提供了一种可解释的表示,有助于理解场景元素如何在 LLM 及其他模型中影响情绪感知。其次,我们测试了一个大型语言模型从所得图像描述文本推断情绪的能力。我们发现 GPT-3.5,特别是 text-davinci-003 模型,提供了与人类标注惊人一致且合理的情绪预测,但准确性可能依赖于情绪概念。总体而言,结果表明图像描述文本与 LLM 的方法具有前景。

关键词

引用

@article{arxiv.2309.13136,
  title  = {Contextual Emotion Estimation from Image Captions},
  author = {Vera Yang and Archita Srivastava and Yasaman Etesam and Chuxuan Zhang and Angelica Lim},
  journal= {arXiv preprint arXiv:2309.13136},
  year   = {2023}
}

备注

Accepted to ACII 2023. Project page: http://rosielab.github.io/emotion-captions/