面向视觉搜索的目标级注意力变换器 OAT
计算机视觉与模式识别
2024-07-19 v1
摘要
视觉搜索是我们日常生活中重要的活动。有效分配视觉注意力对于高效完成视觉搜索任务至关重要。先前的研究主要在像素级别建模视觉注意力的空间分配,例如使用显著性图。然而,越来越多的证据表明,视觉注意力是由对象而非像素强度引导的。本文引入了目标级注意力变换器(Object-level Attention Transformer, OAT),用于预测在杂乱场景中搜索目标对象的人类扫描路径。OAT 使用编码器-解码器架构。编码器捕获图像中对象的位置和外观信息以及目标信息。解码器通过整合编码器和解码器的输出特征,预测 gaze scanpath 作为一系列对象注视。我们还提出了一种新的位置编码,更好地反映对象之间的空间关系。我们在亚马逊书籍封面数据集和我们收集的用于视觉搜索的新数据集上评估了OAT。OAT 的预测 gaze 扫描路径与人类 gaze 模式更吻合,无论是基于既定指标还是基于新型行为学指标的算法,都表现出更好的预测性能。我们的结果表明,OAT 具备泛化能力,能够准确预测未知布局和目标对象的人类扫描路径。
引用
@article{arxiv.2407.13335,
title = {OAT: Object-Level Attention Transformer for Gaze Scanpath Prediction},
author = {Yini Fang and Jingling Yu and Haozheng Zhang and Ralf van der Lans and Bertram Shi},
journal= {arXiv preprint arXiv:2407.13335},
year = {2024}
}
备注
Accepted in ECCV 2024