中文

通过视觉基础模型像素级监督提升注视对象预测

计算机视觉与模式识别 2024-08-05 v1

摘要

注视对象预测(GOP)旨在预测人类注视的物体类别与位置。以前的方法利用盒级监督来识别人们注视的物体,但在语义歧义方面存在困难,即单个盒子可能包含多个物品,因为物体彼此靠近。视觉基础模型(VFM)在使用盒提示进行对象分割方面取得了进展,这可以通过更精确地定位物体来减少混淆,为对注视对象的细粒度预测提供了优势。本文提出了更具挑战性的注视对象分割(GOS)任务,即推断由人类注视行为捕获的物体对应的像素级掩码。具体而言,我们提出将VFM提供的像素级监督整合到注视对象预测中,以缓解语义歧义。这导致了我们的注视对象检测和分割框架,实现了准确的像素级预测。不同于需要额外头部输入或忽略头部特征的先前方法,我们提出自动从场景特征中获取头部特征,以确保模型的推理效率和灵活性。此外,与现有方法直接融合特征预测注视热图不同,我们开发了一种空间到对象注视回归方法,以促进人类与物体的注视交互。具体做法是首先构建初始的人类-物体空间连接,然后通过与分割分支中语义清晰特征的交互来细化该连接,最终预测用于精确定位的注视热图。在GOO-Synth和GOO-Real数据集上进行的广泛实验表明,我们方法的有效性。

关键词

引用

@article{arxiv.2408.01044,
  title  = {Boosting Gaze Object Prediction via Pixel-level Supervision from Vision Foundation Model},
  author = {Yang Jin and Lei Zhang and Shi Yan and Bin Fan and Binglu Wang},
  journal= {arXiv preprint arXiv:2408.01044},
  year   = {2024}
}

备注

Accepted by ECCV2024