用于面部表情识别与动作单元检测的可变状态隐条件随机场
计算机视觉与模式识别
2015-10-15 v1 人机交互
摘要
从视频中自动识别情绪面部表情并检测面部动作单元(AUs),关键取决于对其动态变化的建模。这些动态变化的特征在于时间相位(起始-顶点-偏移)以及情绪表情和 AUs 强度的变化,其外观在目标对象间可能存在显著差异,使得识别/检测任务极具挑战性。最先进的隐条件随机场(L-CRF)框架能够通过隐状态高效编码这些动态,从而考虑情绪表达的时间一致性和其强度水平间的序数关系,这些隐状态通常被假设为无序(名义)或全有序(序数)。然而,这种方法往往过于受限。例如,在 AU 检测中,目标是区分图像序列中该 AU 激活或非激活的片段。虽然包含目标 AU 激活的序列片段可能更适合用有序隐状态描述,但非激活片段更适合用无序(名义)隐状态描述,因为无法对其底层结构作任何假设(因为它们可能包含中性脸或非目标 AUs 的激活)。为此,我们提出可变状态 L-CRF(VSL-CRF)模型,可自动为目标图像序列选择最优隐状态。为减少模型对名义或序数隐状态的过拟合,我们提出一种新颖的隐状态图拉普拉斯正则化(graph-Laplacian regularization)。我们在三个公开表情数据库上的实验表明,相较于传统 L-CRFs 及其他相关最先进模型,所提模型取得了更好的泛化性能。
引用
@article{arxiv.1510.03909,
title = {Variable-state Latent Conditional Random Fields for Facial Expression Recognition and Action Unit Detection},
author = {Robert Walecki and Ognjen Rudovic and Vladimir Pavlovic and Maja Pantic},
journal= {arXiv preprint arXiv:1510.03909},
year = {2015}
}