面向多样视频的可扩展神经表示
计算机视觉与模式识别
2023-03-27 v1
摘要
隐式神经表示(INR)在表示3D场景和图像方面受到越来越多的关注,并最近被应用于编码视频(如NeRV、E-NeRV)。尽管取得了有前景的结果,现有基于INR的方法仅限于编码少量短视频(如UVG数据集中的七个5秒视频),且视觉内容冗余,导致模型设计独立拟合各个视频帧,无法高效扩展到大量多样视频。本文致力于为更实际的设定开发神经表示——编码具有多样视觉内容的长视频和/或大量视频。我们首先表明,与将视频分成小子集并用单独模型编码相比,用统一模型联合编码长且多样的视频能获得更好的压缩结果。基于该观察,我们提出D-NeRV,一种新颖的神经表示框架,旨在通过(i)将片段特定视觉内容从运动信息中解耦,(ii)将时间推理引入隐式神经网络,以及(iii)以任务导向光流作为中间输出来减少空间冗余,从而编码多样视频。我们的新模型在UCF101和UVG数据集的视频压缩任务上大幅超越NeRV和传统视频压缩技术。此外,当用作高效数据加载器时,在相同压缩比下,D-NeRV在UCF101数据集的动作识别任务上比NeRV高出3%–10%的准确率。
引用
@article{arxiv.2303.14124,
title = {Towards Scalable Neural Representation for Diverse Videos},
author = {Bo He and Xitong Yang and Hanyu Wang and Zuxuan Wu and Hao Chen and Shuaiyi Huang and Yixuan Ren and Ser-Nam Lim and Abhinav Shrivastava},
journal= {arXiv preprint arXiv:2303.14124},
year = {2023}
}
备注
Accepted at CVPR 2023