ODE-ViT:将视觉Transformer推广为常微分方程的可插即用注意力层
机器学习
2025-11-21 v1 人工智能
摘要
近年来,越来越大的模型在计算机视觉任务中取得了卓越的性能,但这些模型需要大量的计算资源和存储,其日益复杂的模型限制了我们对其决策方式的理解。大多数这些架构依赖于基于Transformer设计中的注意力机制。基于残差神经网络与常微分方程(ODE)之间的联系,我们引入ODE-ViT,将其作为满足良好动力学条件的稳定ODE系统重新表述为视觉Transformer。在CIFAR-10和CIFAR-100上的实验表明,ODE-ViT以稳定、可解释且具竞争力的性能实现了最高可达一个数量级更少的参数,超过了先前基于ODE的Transformer方法在分类任务中的表现。我们进一步提出了一种可插即用的教师-学生框架,其中离散ViT通过将教师的中间表示视为ODE的解决方案,从而指导ODE-ViT的连续轨迹。该策略比从头训练自由ODE-ViT的性能提高了超过10%。
引用
@article{arxiv.2511.16501,
title = {ODE-ViT: Plug & Play Attention Layer from the Generalization of the ViT as an Ordinary Differential Equation},
author = {Carlos Boned Riera and David Romero Sanchez and Oriol Ramos Terrades},
journal= {arXiv preprint arXiv:2511.16501},
year = {2025}
}