中文

EMO-LLaMA:通过指令微调增强面部情绪理解

计算机视觉与模式识别 2024-08-22 v1

摘要

面部表情识别(FER)是情感人工智能中的重要研究主题。近些年来,研究者取得了显著进展。然而,当前的FER方法在泛化性方面存在挑战,缺乏与自然语言对齐的语义信息,同时难以在统一框架内处理图像和视频,限制了其在多模态情感理解和人机交互中的应用。多模态大语言模型(MLLM)近期取得了成功,能够解决上述问题,潜在地克服当前FER方法的局限性。然而,直接将预训练MLLM应用于FER仍面临诸多挑战。我们对现有开源MLLM在FER上的零样本评估表明,其性能与GPT-4V及当前监督式SOTA方法存在显著差距。本文旨在增强MLLM理解面部表情的能力。我们首先生成五个FER数据集的指令数据。随后,我们提出一种新型MLLM,称为EMO-LLaMA,其融合来自预训练面部分析网络的面部先验信息,以增强人脸信息。具体而言,我们设计了面部信息挖掘模块,用于提取全局和局部面部信息。此外,我们利用手工提示词引入年龄、性别、种族属性,考虑到不同人群在情绪上的差异。大量实验表明,EMO-LLaMA在静态和动态FER数据集上均实现了与SOTA相当或可竞争的结果。该指令数据集和代码已公开于https://github.com/xxtars/EMO-LLaMA。

关键词

引用

@article{arxiv.2408.11424,
  title  = {EMO-LLaMA: Enhancing Facial Emotion Understanding with Instruction Tuning},
  author = {Bohao Xing and Zitong Yu and Xin Liu and Kaishen Yuan and Qilang Ye and Weicheng Xie and Huanjing Yue and Jingyu Yang and Heikki Kälviäinen},
  journal= {arXiv preprint arXiv:2408.11424},
  year   = {2024}
}