中文

低维空间中可学习网格如何恢复细节:多网格参数编码的神经张量核分析

计算机视觉与模式识别 2025-04-21 v1 机器学习

摘要

将低维空间映射的神经网络在计算机图形和科学计算中广泛应用;但在原始实现中,无法学习高频信息。我们对比分析了两种最常用的缓解此光谱偏置技术:傅里叶特征编码(FFE)和多网格参数编码(MPE)。FFE 被视为低维映射的标准,但 MPE 往往表现更好,学习的表示具有更高分辨率和更细致的细节。FFE 基于傅里叶变换,若被过度推进则易产生混叠,而 MPE 采用可学习网格结构,无此限制。为理解性能差异,我们使用神经张量核(NTK)通过类似核回归的方式评估这些编码。通过求出 NTK 最小特征值的下界,我们证明 MPE 通过其网格结构提高网络性能,而非其可学习嵌入。该机制与 FFE 不同,后者仅依赖其嵌入空间提升性能。结果在 2D 图像回归任务中经验验证,使用来自 ImageNet 100 个同义词集合的图像以及来自斯坦福图形数据集的 3D 隐式曲面回归。使用峰值信噪比(PSNR)和多尺度结构相似性(MS-SSIM)评估细节学习效果,表明 MPE 在基准上提升了 8 个数量级的最小特征值,比 FFE 高 2 个数量级;频谱对应于基准提升 15 dB(PSNR)/0.65(MS-SSIM),比 FFE 提升 12 dB(PSNR)/0.33(MS-SSIM)。

关键词

引用

@article{arxiv.2504.13412,
  title  = {How Learnable Grids Recover Fine Detail in Low Dimensions: A Neural Tangent Kernel Analysis of Multigrid Parametric Encodings},
  author = {Samuel Audia and Soheil Feizi and Matthias Zwicker and Dinesh Manocha},
  journal= {arXiv preprint arXiv:2504.13412},
  year   = {2025}
}