中文

显著性感知的立体视频重定向

计算机视觉与模式识别 2023-04-19 v1

摘要

立体视频重定向旨在将图像缩放至所需宽高比。重定向视频的质量会受到立体视频的空间、时间和视差一致性的显著影响,而这些一致性均可能被重定向过程破坏。由于缺乏公开可用的标注数据集,基于深度学习的立体视频重定向方法研究甚少。本文提出一种无监督的基于深度学习的立体视频重定向网络。我们的模型首先检测显著对象,并对所有对象进行平移与变形,以最小化立体帧显著部分的失真。我们使用一维卷积平移显著对象,并设计了一个立体视频Transformer来辅助重定向过程。为训练网络,我们利用视差注意力机制融合左右视图,并将重定向后的帧输入重建模块,该模块将重定向帧逆恢复为输入帧。因此,网络以无监督方式训练。在KITTI stereo 2012和2015数据集上的大量定性与定量实验及消融研究证明了所提方法相对于现有最优方法的效率。代码见 https://github.com/z65451/SVR/。

关键词

引用

@article{arxiv.2304.08852,
  title  = {Saliency-aware Stereoscopic Video Retargeting},
  author = {Hassan Imani and Md Baharul Islam and Lai-Kuan Wong},
  journal= {arXiv preprint arXiv:2304.08852},
  year   = {2023}
}

备注

8 pages excluding references. CVPRW conference