中文

GazeProphet:面向VR全景渲染的无硬件眼动预测

计算机视觉与模式识别 2025-10-10 v2

摘要

全景渲染显著减少了虚拟现实应用中的计算需求,通过将渲染质量集中于用户注视的焦点位置来实现。当前方法需要昂贵的硬件基眼动跟踪系统,限制了其因成本、校准复杂度和硬件兼容性约束而广泛采用的普及。本文提出了GazeProphet,一种无需专用眼动跟踪硬件即可预测VR环境中注视位置的软件方法。该方法结合了用于处理360度VR场景的球面 Vision Transformer 和捕获注视序列模式的 LSTM 基于时间的编码器。多模态融合网络整合了空间场景特征与时间眼动动态,以预测未来注视位置并提供相应的置信度估计。针对一个全面的VR数据集进行实验评估,结果显示GazeProphet实现了3.83度的中位数角度误差,相较于传统基于显著性的基线提高了24%,同时提供了可靠的置信度校准。该方法在不同的空间区域和场景类型下保持一致的性能,使其能够在无需额外硬件要求的情况下实现VR系统的实际部署。统计分析确认了在所有评估指标上的改进的显著性。这些结果表明,无硬件的眼动预测可用于VR全景渲染,使这一性能提升更易于在不同的VR平台和应用中实现。

关键词

引用

@article{arxiv.2508.13546,
  title  = {GazeProphet: Software-Only Gaze Prediction for VR Foveated Rendering},
  author = {Farhaan Ebadulla and Chiraag Mudlapur and Gaurav BV},
  journal= {arXiv preprint arXiv:2508.13546},
  year   = {2025}
}

备注

8 pages, 3 figures