中文

基于大型语言模型的统一面部动作单元识别框架

计算机视觉与模式识别 2024-09-16 v1

摘要

面部动作单元(Facial Action Units, AUs)在情感计算领域具有重要意义。在本文中,我们提出了 AU-LLaVA,这是第一个基于大型语言模型(Large Language Model, LLM)的统一 AU 识别框架。AU-LLaVA 由视觉编码器、线性投影层和预训练 LLM 组成。我们精心设计了文本描述,并在各种 AU 数据集上对模型进行微调,使其能够针对同一输入图像生成不同格式的 AU 识别结果。在 BP4D 和 DISFA 数据集上,AU-LLaVA 为近一半的 AU 提供了最准确的识别结果。与先前的基准结果相比,在特定 AU 的识别中,我们的模型 F1-score 提升最高达 11.4%。在 FEAFA 数据集上,与先前的基准结果相比,我们的方法在全部 24 个 AU 上均取得了显著提升。AU-LLaVA 在 AU 识别中展现出了卓越的性能和通用性。

关键词

引用

@article{arxiv.2409.08444,
  title  = {Towards Unified Facial Action Unit Recognition Framework by Large Language Models},
  author = {Guohong Hu and Xing Lan and Hanyu Jiang and Jiayi Lyu and Jian Xue},
  journal= {arXiv preprint arXiv:2409.08444},
  year   = {2024}
}