中文

TokenUnify: 面向神经元分割的自回归预训练规模化

计算机视觉与模式识别 2025-08-26 v2 人工智能

摘要

从电子显微镜(EM)体数据中进行神经元分割对于理解大脑回路至关重要,然而高分辨率EM图像中复杂的神经元结构带来了巨大挑战。EM数据展现出独特的特性,包括高噪声水平、各向异性体素尺寸以及超长空间依赖性,这使得传统的视觉模型难以胜任。受语言模型中自回归预训练的启发,我们提出了TokenUnify,这是一种分层预测编码框架,通过三个互补的学习目标来捕获多尺度依赖性。TokenUnify集成了随机令牌预测、下一令牌预测和下一所有令牌预测,以创建一个具有涌现特性的综合表示空间。从信息论的角度来看,这三个任务是互补的,并为视觉数据结构提供了最优覆盖,我们的方法将长度为K的序列的自回归误差累积从O(K)减少到O(sqrt(K))。我们还引入了一个包含12亿个标注体素的大规模EM数据集,提供了具有空间连续性的理想长序列视觉数据。利用Mamba架构的线性时间序列建模能力,TokenUnify在下游神经元分割任务上实现了44%的性能提升,并比MAE高出25%。我们的方法展示了随着模型规模增大而表现出的优越扩展特性,有效地弥合了语言和视觉模型预训练策略之间的差距。

关键词

引用

@article{arxiv.2405.16847,
  title  = {TokenUnify: Scaling Up Autoregressive Pretraining for Neuron Segmentation},
  author = {Yinda Chen and Haoyuan Shi and Xiaoyu Liu and Te Shi and Ruobing Zhang and Dong Liu and Zhiwei Xiong and Feng Wu},
  journal= {arXiv preprint arXiv:2405.16847},
  year   = {2025}
}

备注

Accepted by ICCV 2025