MsFIN:用于交通事故预测的多尺度特征交互网络
计算机视觉与模式识别
2025-09-24 v1 人工智能
摘要
随着行车记录仪的广泛部署和计算机视觉的进步,从行车记录仪视角开发事故预测模型对于主动安全干预变得至关重要。然而,仍存在两个关键挑战:对交通参与者(在行车记录仪视角中常被遮挡)之间的特征级交互进行建模,以及捕获事故发生前复杂的、异步的多时间行为线索。为了应对这两个挑战,提出了一种多尺度特征交互网络(MsFIN),用于从行车记录仪视频中进行早期事故预测。MsFIN 包含三个层,分别用于多尺度特征聚合、时间特征处理和多尺度特征后融合。在多尺度特征聚合方面,设计了一个多尺度模块,用于在短期、中期和长期时间尺度上提取场景表示。同时,利用 Transformer 架构来促进全面的特征交互。时间特征处理在因果约束下捕获场景和对象特征的序列演化。在多尺度特征后融合阶段,网络跨多个时间尺度融合场景和对象特征,以生成综合的风险表示。在 DAD 和 DADA 数据集上的实验表明,MsFIN 在预测准确性和时效性上均显著优于具有单尺度特征提取的最先进模型。消融实验验证了 MsFIN 中每个模块的有效性,突出了该网络如何通过多尺度特征融合和上下文交互建模实现卓越性能。
引用
@article{arxiv.2509.19227,
title = {MsFIN: Multi-scale Feature Interaction Network for Traffic Accident Anticipation},
author = {Tongshuai Wu and Chao Lu and Ze Song and Yunlong Lin and Sizhe Fan and Xuemei Chen},
journal= {arXiv preprint arXiv:2509.19227},
year = {2025}
}