中文

离散面部编码:面向数据驱动面部显示发现的框架

计算机视觉与模式识别 2025-10-03 v1

摘要

面部表情分析是理解人类行为的核心任务,但现有编码系统如面部动作编码系统(FACS)受限于覆盖范围有限和手动标注成本高。本文介绍了离散面部编码(Discrete Facial Encoding, DFE),一种基于残差向量量化变分自编码器(RVQ-VAE)学习的无监督、数据驱动的面部表情紧凑且可解释的词典。我们的 方法首先利用3D形状可演化模型(3DMM)从图像中提取面部表情特征,从而有效分离头部姿态和面部几何等因素。随后通过RVQ-VAE对这些特征进行编码,生成来自共享码本的离散标记序列,其中每个标记捕捉特定的、可重复使用的面部变形模式,从而贡献于整体表情。通过大量实验,我们展示离散面部编码比FACS及其他面部编码方法更精确地捕捉面部行为。我们评估了该表示在三个高层心理任务中的实用性:压力检测、性格预测和抑郁检测。基于所学标记构建的简单词袋模型,使我们的方法在对抗FACS基线方法以及诸如掩码自编码器等强大的图像和视频表示学习模型时 consistently 取得优势。进一步分析表明,我们的表示涵盖了更广泛的面部显示,凸显其作为心理学和情感计算应用中FACS的可扩展且有效的替代方案的潜力。

关键词

引用

@article{arxiv.2510.01662,
  title  = {Discrete Facial Encoding: : A Framework for Data-driven Facial Display Discovery},
  author = {Minh Tran and Maksim Siniukov and Zhangyu Jin and Mohammad Soleymani},
  journal= {arXiv preprint arXiv:2510.01662},
  year   = {2025}
}