中文

基于 TSOD10K 数据集的交通场景显著物体检测

计算机视觉与模式识别 2025-03-24 v1

摘要

Traffic Salient Object Detection (TSOD) 旨在通过结合 semantic (如 collision risks) 与 visual saliency 来分割对驾驶安全至关重要的对象。不同于自然场景图像 (NSI-SOD),后者侧重于视觉突出区域,TSOD 强调即使在 low visual contrast 下也因 semantic impact 而需要 driver 立即注意的对象。这一双重标准,即桥接 perception 与 contextual risk,重新定义了 autonomous 与 assisted driving 系统中的 saliency。为解决 task-specific benchmark 缺乏的问题,我们收集了首个大规模 TSOD 数据集,命名为 TSOD10K。TSOD10K 涵盖多样 object 类别于 various real-world traffic scenes,包含 various challenging weather/illumination variations(如雾、暴雪、低对比度及低光照)。方法论上,我们提出一种 Mamba-based TSOD 模型,称为 Tramba。考虑到区分 inconspicuous visual 信息与 complex traffic background 的挑战,Tramba 引入 novel Dual-Frequency Visual State Space 模块,配合 shifted window partitioning 与 dilated scanning,以层次化分解 high/low-frequency 组件来增强对 fine details 与 global structure 的感知。为强调 traffic scenes 中的 critical 区域,我们提出 traffic-oriented Helix 2D-Selective-Scan (Helix-SS2D) 机制,在有效捕获 global multi-direction spatial dependencies 的同时注入 driving attention 先验。我们在 TSOD10K 上评估了 Tramba 与 22 项现有 NSI-SOD 模型,证明 Tramba 的优越性。我们的研究为 intelligent transportation systems 中的 safety-aware saliency 分析奠定了首个基础。

关键词

引用

@article{arxiv.2503.16910,
  title  = {Salient Object Detection in Traffic Scene through the TSOD10K Dataset},
  author = {Yu Qiu and Yuhang Sun and Jie Mei and Lin Xiao and Jing Xu},
  journal= {arXiv preprint arXiv:2503.16910},
  year   = {2025}
}

备注

12 pages, 12 figures