Gaze-LLE:通过大规模学习编码器进行注视目标估计
计算机视觉与模式识别
2025-06-05 v2
摘要
我们解决了注视目标估计问题,该问题旨在预测一个人在场景中的注视位置。预测一个人的注视目标需要同时考虑该人的外貌和场景内容。先前的工作开发了日益复杂的、手工设计的注视目标估计流程,这些流程精心融合了来自独立场景编码器、头部编码器以及用于深度和姿态等信号的辅助模型的特征。受通用特征提取器在各种视觉任务中取得成功的启发,我们提出了Gaze-LLE,一种新颖的Transformer框架,通过利用冻结的DINOv2编码器的特征来简化注视目标估计。我们为场景提取单一特征表示,并应用特定于人的位置提示,通过轻量级模块解码注视。我们在多个注视基准上展示了最先进的性能,并进行了广泛的分析以验证我们的设计选择。我们的代码可在 http://github.com/fkryan/gazelle 获取。
引用
@article{arxiv.2412.09586,
title = {Gaze-LLE: Gaze Target Estimation via Large-Scale Learned Encoders},
author = {Fiona Ryan and Ajay Bati and Sangmin Lee and Daniel Bolya and Judy Hoffman and James M. Rehg},
journal= {arXiv preprint arXiv:2412.09586},
year = {2025}
}
备注
CVPR 2025 Highlight