基于 Transformer 模型的事件型视觉显著性预测探索
计算机视觉与模式识别
2026-05-25 v1
摘要
视觉显著性预测已在 RGB 图像和视频中广泛研究,作为人类视觉注意力的计算模型。相比之下,针对事件数据(event-based data)的显著性预测仍鲜有探索,尽管事件相机具有生物学启发性和优异的感知特性。两大障碍阻碍了此方向的发展:缺乏大规模事件显著性数据集,以及缺乏强有力的基准模型。本文引入 SEST(Swin Event-based Saliency Transformer),即基于 Transformer 的事件显著性预测模型,通过事件原生预训练和合成监督桥接数据稀缺瓶颈。SEST 利用自监督预训练的事件型 Swin Transformer 主干网络搭配轻量级 CNN 解码器,生成动态显著性图。为解决缺乏标注事件显著性数据的困境,本文引入两个新的基准数据集 N-DHF1K 和 N-UCF Sports,这些数据集源自大规模 RGB 显著性基准。实验结果表明,SEST 在现有事件显著性方法中显著优于其他模型,并缩小了与最先进 RGB 模型之间的性能差距。零样本评估于真实事件相机数据集进一步表明,基于合成数据的训练模型在真实事件流上仍具可迁移性。据我们所知,本工作是首次将深度学习应用于事件显著性预测,开启了事件视觉与神经形态视觉注意力交叉领域的新研究方向。
引用
@article{arxiv.2605.23790,
title = {Exploring deep learning for Event-Based Saliency Prediction with a Transformer-based model},
author = {Romaric Mazna and Jean Martinet and Sai Deepesh Pokala},
journal= {arXiv preprint arXiv:2605.23790},
year = {2026}
}