面向面部行为理解的弱监督文本驱动对比学习
计算机视觉与模式识别
2023-08-28 v2
摘要
对比学习已展现出利用无标签数据学习鲁棒表示的良好潜力。然而,在面部行为数据集上构建有效的正负样本对用于对比学习仍具挑战。这是因为此类样本对不可避免地编码了受试者ID信息,且因面部行为数据集中受试者数量有限,随机构建的样本对可能将相似面部图像推远。为解决此问题,我们提出利用活动描述——某些数据集中提供的粗粒度信息,其可提供图像序列的高层语义信息,却在既往研究中常被忽视。更具体地,我们引入两阶段文本嵌入对比学习框架用于面部行为理解(CLEF)。第一阶段为弱监督对比学习方法,从利用粗粒度活动信息构建的正负样本对中学习表示。第二阶段旨在通过最大化图像与对应文本标签名间的相似性来训练面部表情或面部动作单元识别。所提CLEF在三个实验室AU识别数据集与三个自然场景面部表情识别数据集上取得了最先进性能。
引用
@article{arxiv.2304.00058,
title = {Weakly-Supervised Text-driven Contrastive Learning for Facial Behavior Understanding},
author = {Xiang Zhang and Taoyue Wang and Xiaotian Li and Huiyuan Yang and Lijun Yin},
journal= {arXiv preprint arXiv:2304.00058},
year = {2023}
}