CaTFormer:用于驾驶意图预测的具有动态上下文融合的因果时序Transformer
计算机视觉与模式识别
2026-01-09 v2 人工智能
摘要
准确预测驾驶意图是增强人机共驾系统安全性和交互效率的关键。它是实现高级别自动驾驶的基石。然而,当前的方法在精确建模人类驾驶行为的复杂时空依赖性和不可预测的变异性方面仍然不足。为了应对这些挑战,我们提出了CaTFormer,一种因果时序Transformer,它显式地对驾驶员行为与环境上下文之间的因果交互进行建模,以实现鲁棒的意图预测。具体来说,CaTFormer引入了一种新颖的互逆延迟融合(RDF)机制,用于内部和外部特征流的精确时间对齐;一个反事实残差编码(CRE)模块,系统地消除虚假相关性以揭示真实的因果依赖关系;以及一个创新的特征合成网络(FSN),自适应地将这些净化后的表示合成为连贯的时序表示。实验结果表明,CaTFormer在Brain4Cars数据集上达到了最先进的性能。它有效地捕获了复杂的因果时序依赖关系,并提高了驾驶意图预测的准确性和透明度。
引用
@article{arxiv.2507.13425,
title = {CaTFormer: Causal Temporal Transformer with Dynamic Contextual Fusion for Driving Intention Prediction},
author = {Sirui Wang and Zhou Guan and Bingxi Zhao and Tongjia Gu and Jie Liu},
journal= {arXiv preprint arXiv:2507.13425},
year = {2026}
}
备注
Accepted at AAAI 2026