面向视线跟随的像素级预测:基准与方法
计算机视觉与模式识别
2025-02-05 v2
摘要
跟随他人视线并分析其所注视的目标,可帮助我们理解他们正在思考和行动的内容,以及可能随之而来的行为。现有视线跟随方法在自然场景中表现不佳,尤其是关注视线点而非目标,导致难以提供清晰的语义和准确的目标范围。为此,我们提出一种名为GazeSeg的新型视线目标预测解决方案,能够充分利用人的视野空间作为指导信息,实现从粗到细的视线目标分割和识别过程。具体而言,基于提示的视觉基础模型作为编码器,配合三个不同的解码模块(如视野感知、热图生成和分割),构成视线目标预测的框架。随后,基于头部边界框作为初始提示,GazeSeg获得视野图、热图和分割图,从而形成用于多任务(如方向估计、视线目标分割和识别)的统一框架。为促进此项研究,我们构建并公开了一个新数据集,包含72,000张图像,涵盖像素级标注和270个视线目标类别,基于GazeFollow数据集构建。定量评估显示,我们的方法在视线目标分割上实现Dice系数0.325,识别率达71.7%。与前沿方法相比,我们的方法在视线跟随任务上实现AUC为0.953。数据集和代码将予以公开。
引用
@article{arxiv.2412.00309,
title = {Towards Pixel-Level Prediction for Gaze Following: Benchmark and Approach},
author = {Feiyang Liu and Dan Guo and Jingyuan Xu and Zihao He and Shengeng Tang and Kun Li and Meng Wang},
journal= {arXiv preprint arXiv:2412.00309},
year = {2025}
}
备注
After discussions among the authors, we believe that some experiments in the paper still require further improvement, and we have decided to withdraw it for the time being