中文

视频多项式神经表征 PNeRV

计算机视觉与模式识别 2024-06-28 v1

摘要

从视频数据中提取隐式神经表征(INR)面临独特挑战,因其包含额外的时间维度。视频领域的 INR 主要依赖帧级参数化,牺牲了像素级(空间)表征中观察到的时空连续性。为缓解此问题,我们引入多项式神经表征用于视频(PNeRV),这是一种在参数层面上高效、针对 patch 的 INR,能够保持时空连续性。PNeRV 利用多项式神经网络的建模能力,对连续空间(patch)信号进行调制,以连续时间(帧)信号为驱动。我们进一步提出了自定义的分层 patch-wise 空间抽样方案,确保空间连续性的同时保持参数效率。我们还采用精心设计的位置嵌入方法进一步提升 PNeRV 的性能。广泛的实验表明,PNeRV 在传统隐式神经表示任务中的压缩性能优于基线方法,同时在需要底层表征时空连续性的下游应用中亦表现出色。PNeRV 不仅解决了视频数据在 INR 领域的挑战,也为高级视频处理和分析开辟了新方向。

关键词

引用

@article{arxiv.2406.19299,
  title  = {PNeRV: A Polynomial Neural Representation for Videos},
  author = {Sonam Gupta and Snehal Singh Tomar and Grigorios G Chrysos and Sukhendu Das and A. N. Rajagopalan},
  journal= {arXiv preprint arXiv:2406.19299},
  year   = {2024}
}

备注

25 pages, 17 figures, published at TMLR, Feb 2024