中文

ATSal:一种用于 360 视频显著性预测的基于注意力的架构

计算机视觉与模式识别 2020-11-24 v1 机器学习

摘要

360 视频/图像的球面域表示带来了与全向视频(ODV)的存储、处理、传输和渲染相关的诸多挑战。人类视觉注意模型可用于仅同时渲染单个视口,这在开发允许用户通过头戴式显示器(HMD)探索 ODV 的系统时十分重要。相应地,研究者已提出多种针对 360 视频/图像的显著性模型。本文提出 ATSal,一种用于 360° 视频的基于注意力(头-眼)的显著性新模型。该注意力机制显式编码全局静态视觉注意,使专家模型能够专注于学习连续帧中局部块的显著性。我们在两个数据集 Salient360! 和 VR-EyeTracking 上将所提方法与其他最先进的显著性模型进行比较。在超过 80 个 ODV 视频(75K+ 帧)上的实验结果表明,所提方法优于现有最先进水平。

关键词

引用

@article{arxiv.2011.10600,
  title  = {ATSal: An Attention Based Architecture for Saliency Prediction in 360 Videos},
  author = {Yasser Dahou and Marouane Tliba and Kevin McGuinness and Noel O'Connor},
  journal= {arXiv preprint arXiv:2011.10600},
  year   = {2020}
}