中文

压缩视频中互信息正则化身份感知的人脸表情识别

范畴论 2020-10-22 v1

摘要

如何提取对身份特定属性不变的有效表情表示是人脸表情识别(FER)中的一个长期问题。以往多数方法处理序列的 RGB 图像,而我们认为现成且有价值的与表情相关的肌肉运动已嵌入在压缩格式中。本文中,我们旨在探索压缩视频域中去除了主体间差异的人脸表情表示。在压缩程度高达两个数量级的域中,我们可从残差帧显式推断表情,并可能利用预训练人脸识别网络从 I 帧提取身份因子。通过强制它们的边缘独立性,期望表情特征对表情更纯净且对身份偏移具有鲁棒性。具体而言,我们提出了一种新颖的潜在空间互信息(MI)最小化的协同最小-最小博弈。我们无需身份标签或同一人的多个表情样本即可实现身份消除。此外,当数据集中标注了顶点帧时,可进一步加入互补约束以正则化特征级博弈。测试时,仅需压缩残差帧即可实现表情预测。我们的方案在典型 FER 基准上取得与近期基于解码图像的方法相当或更好的性能,且推理速度约快 3 倍。

关键词

引用

@article{arxiv.2010.10636,
  title  = {A theory of 2-pro-objects, a theory of 2-model 2-categories and the 2-model structure for 2-Pro(C)},
  author = {Maria Emilia Descotte},
  journal= {arXiv preprint arXiv:2010.10636},
  year   = {2020}
}

备注

My PhD thesis, from UBA, Buenos Aires, Argentina, date July 7, 2015, advisor Eduardo J. Dubuc. Full text is in English