中文

基于运动聚焦的 RGB-Event 协作稀疏化用于高效目标检测

计算机视觉与模式识别 2025-09-05 v1

摘要

现有的 RGB-Event 检测方法在特征提取和融合过程中统一处理两大模态(图像中的背景和事件数据中的非事件区域),导致计算成本高昂且性能次优。为缓解特征提取中的计算冗余,研究者分别提出了针对图像和事件模态的 token 稀疏化方法。然而,这些方法采用固定数量或阈值的 token 选择方式,难以为复杂程度不同的样本保留有价值的 token。为在准确率和效率之间取得更好平衡,本文提出了 FocusMamba,实现多模态特征的自适应协作稀疏化,并高效整合互补信息。具体而言,设计了基于事件感知的多模态稀疏化策略(Event-Guided Multimodal Sparsification, EGMS),利用事件相机感知的场景内容变化,对每个模态内部的低信息区域进行识别并自适应剔除。基于稀疏化结果,提出了跨模态聚焦融合模块(Cross-Modality Focus Fusion, CMFF),有效捕获并整合两模态的互补特征。在 DSEC-Det 和 PKU-DAVIS-SOD 数据集上的实验表明,所提方法在准确率和效率上均优于现有方法。代码将公开于 https://github.com/Zizzzzzzz/FocusMamba。

关键词

引用

@article{arxiv.2509.03872,
  title  = {Focus Through Motion: RGB-Event Collaborative Token Sparsification for Efficient Object Detection},
  author = {Nan Yang and Yang Wang and Zhanwen Liu and Yuchao Dai and Yang Liu and Xiangmo Zhao},
  journal= {arXiv preprint arXiv:2509.03872},
  year   = {2025}
}