中文

利用条件解码器提升视频的神经表示

图像与视频处理 2024-03-19 v3 人工智能 计算机视觉与模式识别

摘要

隐式神经表示(INRs)已成为视频存储与处理的一种前景广阔的方法,在各类视频任务中展现出卓越的通用性。然而,现有方法往往未能充分利用其表示能力,主要原因是在目标帧解码过程中中间特征的对齐不足。本文提出了一种适用于当前隐式视频表示方法的通用提升框架。具体而言,我们利用带有时间感知仿射变换模块的条件解码器,将帧索引作为先验条件,以有效地将中间特征与目标帧对齐。此外,我们引入了一种正弦 NeRV -like 块,用于生成多样化的中间特征并实现更平衡的参数分布,从而增强模型容量。结合高频信息保持的重建损失,我们的方法成功提升了多个基线 INR 在视频回归任务中的重建质量与收敛速度,并在图像修复和插值方面展现出优异结果。进一步地,我们整合了一致性熵最小化技术,并基于这些增强后的 INR 开发了视频编解码器。在 UVG 数据集上的实验证实,我们增强的编解码器显著优于基线 INR,并与传统及基于学习的编解码器相比提供了具有竞争力的率失真性能。代码地址:https://github.com/Xinjie-Q/Boosting-NeRV。

关键词

引用

@article{arxiv.2402.18152,
  title  = {Boosting Neural Representations for Videos with a Conditional Decoder},
  author = {Xinjie Zhang and Ren Yang and Dailan He and Xingtong Ge and Tongda Xu and Yan Wang and Hongwei Qin and Jun Zhang},
  journal= {arXiv preprint arXiv:2402.18152},
  year   = {2024}
}

备注

Accept by CVPR 2024