探索视觉-语言模型在提升视线跟随中的零样本能力
计算机视觉与模式识别
2024-06-07 v1
摘要
与场景中人物的姿态及其与物体和其他人交互相关的上下文线索可以为视线跟随提供有价值的信息。虽然现有方法侧重于专门的线索提取方法,但在这项工作中,我们研究了视觉-语言模型(VLM)在提取广泛上下文线索以提升视线跟随性能方面的零样本能力。我们首先评估了各种VLM、提示策略和上下文学习(ICL)技术在零样本线索识别中的性能。然后,我们利用这些见解来提取用于视线跟随的上下文线索,并研究将它们整合到该任务的最先进模型中所产生的影响。我们的分析表明,BLIP-2是整体性能最佳的VLM,并且ICL可以提升性能。我们还观察到,VLM对文本提示的选择很敏感,尽管对多个文本提示进行集成可以提供更稳健的性能。此外,我们发现使用整个图像并在目标人物周围绘制椭圆是最有效的视觉提示策略。对于视线跟随,整合提取的线索可以带来更好的泛化性能,尤其是在考虑更大线索集时,这突显了这种方法的潜力。
引用
@article{arxiv.2406.03907,
title = {Exploring the Zero-Shot Capabilities of Vision-Language Models for Improving Gaze Following},
author = {Anshul Gupta and Pierre Vuillecard and Arya Farkhondeh and Jean-Marc Odobez},
journal= {arXiv preprint arXiv:2406.03907},
year = {2024}
}
备注
Accepted at the GAZE Workshop at CVPR 2024