中文

基于眼罩驱动的信息瓶颈学习无监督凝视表示

计算机视觉与模式识别 2024-07-02 v1

摘要

基于外观的监督方法采用全脸图像输入在近期的凝视估计任务中取得了显著进展。然而,强烈的人工标注要求限制了当前方法在工业级精度和鲁棒性方面的实现。尽管当前的无监督预训练框架在许多图像识别任务中取得了成功,但由于面部特征与眼部特征之间的深度耦合,这些框架在从全脸中提取有用凝视特征方面仍存在不足。为缓解上述限制,本工作提出了一种新型无监督/自监督凝视预训练框架,该框架通过协作特征对比和压缩模块,迫使全脸分支在无凝视标注的情况下学习低维凝视嵌入。该框架的核心是交替式眼部注意/未注意掩码训练方案,通过注入瓶颈设计将全脸分支中的凝视相关信息压缩到眼掩码自编码器中,从而成功鼓励模型更关注凝视方向而不仅仅是面部纹理,同时仍采用眼部自重建目标。在此基础上,设计了一种新型的眼/凝视相关信息对比损失,以进一步提升所学表示,迫使模型关注眼部中心区域。广泛的实验结果表明,所提出的方案在多个凝视基准数据集上实现了优于无监督最新方法的优异性能。

关键词

引用

@article{arxiv.2407.00315,
  title  = {Learning Unsupervised Gaze Representation via Eye Mask Driven Information Bottleneck},
  author = {Yangzhou Jiang and Yinxin Lin and Yaoming Wang and Teng Li and Bilian Ke and Bingbing Ni},
  journal= {arXiv preprint arXiv:2407.00315},
  year   = {2024}
}

备注

12 pages, 6 figures, 7 tables