面向事件流的动态稀疏感知混合专家 Transformer 用于视觉对象跟踪
计算机视觉与模式识别
2026-05-08 v1 人工智能
摘要
尽管取得了显著进展,基于 RGB 的跟踪器在面对低光照和快速运动等具挑战性的成像条件时仍然十分脆弱。事件相机通过异步捕获像素级亮度变化,提供了高动态范围和高时间分辨率,因而成为一种有前景的替代方案。然而,现有的事件基跟踪器往往忽视了事件数据固有的空间稀疏性和时间密集性,同时依赖单一的固定时间窗口采样策略,该策略在变化的运动动力学下并不优化。本文提出一种事件稀疏感知跟踪框架,显式建模跨多个时间尺度的事件密度变化。具体而言,该框架逐步将稀疏、中等密度和密集事件搜索区域注入三个阶段的 Vision Transformer 主干网络,从而实现层次化的多密度特征学习。此外,我们引入稀疏感知混合专家模块,以鼓励在不同稀疏模式下对专家进行专业化,并设计动态 pondering 策略以根据跟踪难度自适应调整推理深度。在 FE240hz、COESOT 和 EventVOT 上的大量实验表明,所提方法在跟踪精度和计算效率之间实现了 favorable 的权衡。该代码将在 https://github.com/Event-AHU/OpenEvTracking 上发布。
引用
@article{arxiv.2605.06112,
title = {Dynamic Pondering Sparsity-aware Mixture-of-Experts Transformer for Event Stream based Visual Object Tracking},
author = {Shiao Wang and Xiao Wang and Duoqing Yang and Wenhao Zhang and Bo Jiang and Lin Zhu and Yonghong Tian and Bin Luo},
journal= {arXiv preprint arXiv:2605.06112},
year = {2026}
}