面向端到端可解释面部动作单元识别的视觉-语言联合学习
计算机视觉与模式识别
2024-08-02 v1
摘要
面部动作单元(AU)如面部动作编码系统(FACS)中所定义,因其面部状态分析的广泛应用而受到显著的研究关注。当前的主流FAU识别模型存在一个显著局限,即仅关注AU识别的准确性,而忽视了对应AU状态的解释。在本文中,我们提出了一种端到端的视觉-语言联合学习网络,用于可解释的FAU识别(称为VL-FAU),旨在通过整合联合多模态任务来增强AU表示能力和语言可解释性。具体而言,VL-FAU在优化FAU识别的同时,结合语言模型生成细粒度的局部肌肉描述和可区分的全局面部描述。通过这种方式,全局面部表示及其局部AU表示将在不同AU和不同受试者之间实现更高的区分性。此外,多层级AU表示学习利用多尺度组合面部主干特征来改善AU的个体注意力感知表示能力。在DISFA和BP4D AU数据集上的大量实验表明,所提出的方法在大多数指标上优于最先进的方法。此外,与主流FAU识别方法相比,VL-FAU能够在AU预测的同时提供局部和全局层面的可解释性语言描述。
引用
@article{arxiv.2408.00644,
title = {Towards End-to-End Explainable Facial Action Unit Recognition via Vision-Language Joint Learning},
author = {Xuri Ge and Junchen Fu and Fuhai Chen and Shan An and Nicu Sebe and Joemon M. Jose},
journal= {arXiv preprint arXiv:2408.00644},
year = {2024}
}
备注
10 pages, 5 figures, 4 tables