LG-Gaze:为语言引导的注视估计学习几何感知连续提示
计算机视觉与模式识别
2024-11-14 v1
摘要
注视估计模型的泛化能力常受各种非注视相关因素的显著阻碍,尤其是在训练数据集有限时。当前策略试图通过不同的域泛化技术应对这一挑战,但因仅依赖回归的数值标签而面临过拟合风险,成效有限。预训练视觉-语言模型的最新进展激励我们利用其丰富的语义信息。本文提出一种新方法,将注视估计任务重构为视觉-语言对齐问题。我们提出的框架——语言引导的注视估计(LG-Gaze)——借助视觉-语言模型的丰富先验知识,为注视估计学习连续且几何敏感的特征。具体而言,LG-Gaze通过提出的多模态对比回归损失将注视特征与连续语言特征对齐,该损失为不同样本定制自适应权重。此外,为更好地适应注视估计任务的标签,我们提出一种几何感知插值方法以获得更精确的注视嵌入。通过大量实验,我们在四个不同的跨域评估任务中验证了该框架的有效性。
引用
@article{arxiv.2411.08606,
title = {LG-Gaze: Learning Geometry-aware Continuous Prompts for Language-Guided Gaze Estimation},
author = {Pengwei Yin and Jingjing Wang and Guanzhong Zeng and Di Xie and Jiang Zhu},
journal= {arXiv preprint arXiv:2411.08606},
year = {2024}
}
备注
Accepted to ECCV 2024