Pathformer3D:用于 360° 图像的 3D Scanpath Transformer
计算机视觉与模式识别
2024-07-16 v1
摘要
360° 图像的 scanpath 预测有助于在虚拟/增强现实应用程序中实现快速渲染和更好的用户交互。然而,现有的 360° 图像 scanpath 预测模型是在 2D 等距矩形投影平面上执行的,这会导致由于 2D 平面的畸变和坐标不连续性而产生较大的计算误差。本文我们在 3D 球面坐标系中对 360° 图像进行 scanpath 预测,并提出了一种名为 Pathformer3D 的新型 3D scanpath Transformer。具体而言,首先使用 3D Transformer 编码器提取 360° 图像的 3D 上下文特征表示。然后,将上下文特征表示和历史固定信息输入 Transformer 解码器,以输出当前时间步的固定嵌入,其中 self-attention 模块用于模拟人类视觉系统的视觉工作记忆机制,直接建模固定点之间的时间依赖性。最后,从每个固定嵌入中学习 3D 高斯分布,可用于采样固定位置。在四个全景眼动数据集上的评估表明,Pathformer3D 在当前最先进的方法之外表现更好。代码可在 https://github.com/lsztzp/Pathformer3D 获取。
引用
@article{arxiv.2407.10563,
title = {Pathformer3D: A 3D Scanpath Transformer for 360{\deg} Images},
author = {Rong Quan and Yantao Lai and Mengyu Qiu and Dong Liang},
journal= {arXiv preprint arXiv:2407.10563},
year = {2024}
}
备注
ECCV 2024