通过几何查询语义先验学习三维表面上的人类视觉注意力
计算机视觉与模式识别
2026-02-09 v1
摘要
人类对三维物体的视觉注意力源于底层几何处理与顶部语义识别之间的相互作用。现有三维注意力方法依赖手工设计的几何特征或缺乏语义 awareness 的学习方法,无法解释为何人类会关注语义上有意义但几何上平淡的区域。我们引入 SemGeo-AttentionNet,一种通过非对称跨模态融合显式建模这种二分法的双流架构,利用几何条件多视角渲染中的扩散语义先验和点云变换器进行几何处理。跨注意力确保几何特征查询语义内容,使底层显著性引导顶层检索。我们通过强化学习扩展框架以生成时间扫描路径,引入首个遵循三维网格拓扑并具有抑制-返还动态的 formulation。在 SAL3D、NUS3D 和 3DVA 数据集上的评估表明我们的方法实现了显著提升,验证了受认知启发的架构如何有效建模三维表面上的人类视觉注意力。
引用
@article{arxiv.2602.06419,
title = {Learning Human Visual Attention on 3D Surfaces through Geometry-Queried Semantic Priors},
author = {Soham Pahari and Sandeep C. Kumain},
journal= {arXiv preprint arXiv:2602.06419},
year = {2026}
}