中文

ObjectVisA-120:交互式过街环境中基于对象的视觉注意力预测

计算机视觉与模式识别 2026-02-02 v2

摘要

人类视觉注意力的基于对象特性在认知科学中广为人知,但迄今为止在计算视觉注意力模型中仅扮演次要角色。这主要归因于缺乏适用于基于对象注意力的数据集和评估指标。为解决这些局限性,我们提出了 ObjectVisA-120——一个包含 120 名参与者的虚拟现实空间过街导航数据集,专门用于基于对象的注意力评估。该数据集的独特性在于其涉及的伦理和安全相关挑战,使得在真实世界环境中收集可比数据极为困难。ObjectVisA-120 不仅包含精确的注视数据和虚拟环境中对象的完整状态空间表示,还提供可变的场景复杂度和丰富的标注,包括全景分割、深度信息和车辆关键点。我们进一步提出基于对象的相似度(oSIM)作为评估基于对象视觉注意力模型性能的新指标,这是一种此前未被探索的性能特征。我们的评估表明,显式地针对基于对象注意力进行优化不仅提升了 oSIM 性能,还改善了模型在常见指标上的表现。此外,我们提出了 SUMGraph,一种基于 Mamba U-Net 的模型,该模型以图表示显式编码关键场景对象(车辆),相较于多种最先进的视觉注意力预测方法取得了进一步的性能提升。该数据集、代码和模型将公开发布。

关键词

引用

@article{arxiv.2601.13218,
  title  = {ObjectVisA-120: Object-based Visual Attention Prediction in Interactive Street-crossing Environments},
  author = {Igor Vozniak and Philipp Mueller and Nils Lipp and Janis Sprenger and Konstantin Poddubnyy and Davit Hovhannisyan and Christian Mueller and Andreas Bulling and Philipp Slusallek},
  journal= {arXiv preprint arXiv:2601.13218},
  year   = {2026}
}

备注

Accepted for publication at the IEEE Intelligent Vehicles Symposium (IV), 2026