中文

用于分类的端到端隐式神经表示

计算机视觉与模式识别 2025-03-25 v1

摘要

隐式神经表示 (INR) 如NeRF和SIREN在神经网络参数中对信号进行编码,并在信号重建方面表现优异。然而,将INR用于下游任务(如分类)并不直接。参数中固有的对称性带来挑战,现有工作主要致力于设计对这些对称性具有等变性的架构。然而,基于INR的分类方法仍显著低于基于像素的方法(如CNN)。本工作提出了一种端到端策略,用于初始化SIREN并配合学习率方案,从而获得改善分类准确率的表示。我们展示,一个简单直观的Transformer模型应用于元学习的SIREN,无需显式引入对称性等变性,即可超越当前最佳方法。在CIFAR-10 SIREN分类任务中,我们将带数据增强前的最新成绩从38.8%提升至59.6%,带数据增强前从63.4%提升至64.7%。我们在高分辨率Imagenette数据集上Demonstrate了可扩展性,实现合理的重建质量,分类准确率达60.8%,并首次在完整ImageNet-1K数据集上进行INR分类,实现SIREN分类性能达23.6%。据我们了解,没有其他SIREN分类方法曾在任何高分辨率图像数据集上设定分类基准。我们的代码可在https://github.com/SanderGielisse/MWT 获取。

关键词

引用

@article{arxiv.2503.18123,
  title  = {End-to-End Implicit Neural Representations for Classification},
  author = {Alexander Gielisse and Jan van Gemert},
  journal= {arXiv preprint arXiv:2503.18123},
  year   = {2025}
}

备注

Accepted to CVPR 2025. 8 pages, supplementary material included