结构保持型块解码用于高效神经视频表示
计算机视觉与模式识别
2025-06-27 v2
摘要
隐式神经表示(INR)是广泛研究的主题,特别是在将其应用于通过将空间和时间坐标映射到对应值来建模复杂信号方面。在处理视频时,将紧凑输入映射到整个帧或空间划分的块图像是一种有效的方法。该策略相比坐标映射更好地保持了空间关系、降低了计算开销并提高了重建质量。然而,预测整个帧往往限制了高频视觉细节的重建。此外,基于均匀空间划分的传统块方法往往引入边界不连续性,从而降低空间一致性。我们提出了一种基于结构保持型块(SPPs)的神经视频表示方法来应对此类限制。我们的方法通过类似 PixelUnshuffle 的确定性逐像素分割将每个视频帧分离为空间对齐的块图像。该操作保持了全局空间结构,同时允许块级解码。我们训练解码器来重建这些结构化块,实现一种全局到局部的解码策略,先捕获全局布局再细化局部细节。这有效减少了边界伪影并缓解了朴素上采样带来的失真。在标准视频数据集上的实验表明,我们的方法相比现有的 INR 基线方法实现了更高的重建质量和更好的压缩性能。
引用
@article{arxiv.2506.12896,
title = {Structure-Preserving Patch Decoding for Efficient Neural Video Representation},
author = {Taiga Hayami and Kakeru Koizumi and Hiroshi Watanabe},
journal= {arXiv preprint arXiv:2506.12896},
year = {2025}
}