SVL:基于脉冲的视觉语言预训练,用于高效的 3D 开放世界理解
计算机视觉与模式识别
2026-05-19 v2
摘要
脉冲神经网络(SNNs)提供了一种高效提取 3D 时空特征的方法。然而,现有的 SNN 仍与人工神经网络(ANNs)之间存在显著的性能差距,主要由于不充分的预训练策略。这些限制表现为泛化能力受限、任务特定化,以及在挑战性任务(如多模态问答和零样本 3D 分类)中缺乏多模态理解能力。为克服这些挑战,我们提出了一种基于脉冲的视觉语言(SVL)预训练框架,赋予 SNN 以开放世界 3D 理解能力,同时保持脉冲驱动的效率。SVL 引入了两个关键组件:(i) 多尺度三元对齐(MTA),用于基于标签的三元对比学习跨 3D、图像和文本模态;(ii) 可重参数化的视觉语言集成(Rep-VLI),以在不依赖大型文本编码器的情况下实现轻量级推理。广泛的实验表明,SVL 在零样本 3D 分类中实现了 85.4% 的 top-1 准确率,超越了先进的 ANN 模型,在下游任务上 consistently 优于先前的 SNN,包括 3D 分类(+6.1%)、DVS 动作识别(+2.1%)、3D 检测(+1.1%)和 3D 分割(+2.1%),且具有卓越的效率。此外,SVL 使 SNN 能够执行开放世界 3D 问答,有时甚至超越 ANNs。据我们所知,SVL 代表了首个可扩展、可泛化且面向硬件的 3D 开放世界理解范式,有效弥合了 SNN 和 ANNs 在复杂开放世界理解任务中的差距。代码可在 https://github.com/bollossom/SVL 提供。
引用
@article{arxiv.2505.17674,
title = {SVL: Spike-based Vision-language Pretraining for Efficient 3D Open-world Understanding},
author = {Xuerui Qiu and Peixi Wu and Yaozhi Wen and Shaowei Gu and Yuqi Pan and Xinhao Luo and Bo XU and Guoqi Li},
journal= {arXiv preprint arXiv:2505.17674},
year = {2026}
}
备注
ICML 2026 Spotlight