中文

Bias for Action: 基于偏置调制的视频隐式神经表示

计算机视觉与模式识别 2025-06-10 v2

摘要

我们提出了一种基于隐式神经表示 (INR) 的新型连续视频建模框架,称为 ActINR。我们方法的核心是观察到 INR 可被视为一个可学习的词典,其中基函数的形状由 INR 的权重决定,其位置由偏置决定。给定紧凑的非线性激活函数,我们假设 INR 的偏置适合捕捉图像之间的运动,并促进视频序列的紧凑表示。基于这些观察,我们设计 ActINR 在视频序列的帧之间共享 INR 权重,同时为每一帧使用唯一的偏置。我们进一步将偏置建模为条件于时间索引的单独 INR 的输出,以促进平滑。通过同时训练视频 INR 和此偏置 INR,我们展示了独特的能力,包括 10×10\times 视频慢动作、4x 空间超分辨率伴随 2x 慢动作、去噪和视频填充。ActINR 在诸多视频处理任务中表现出色(常常实现超过 6 dB 的改进),为连续视频建模树立了新标准。

关键词

引用

@article{arxiv.2501.09277,
  title  = {Bias for Action: Video Implicit Neural Representations with Bias Modulation},
  author = {Alper Kayabasi and Anil Kumar Vadathya and Guha Balakrishnan and Vishwanath Saragadam},
  journal= {arXiv preprint arXiv:2501.09277},
  year   = {2025}
}

备注

Accepted to CVPR 2025. Project webpage: https://alpoler.github.io/actioner