ModeSeq: 通过序列模式建模驯服稀疏多模态运动预测
机器学习
2025-03-25 v2 人工智能
计算机视觉与模式识别
机器人学
摘要
预测未来事件的多模态性是安全自动驾驶的基础。然而,由于缺乏多模态真值,交通智能体的多模态运动预测一直受到困扰。现有工作主要采用赢者通吃训练策略来应对这一挑战,但仍然存在轨迹多样性有限和模式置信度未校准的问题。虽然一些方法通过生成过多的轨迹候选来解决这些局限性,但它们需要一个后处理阶段来识别最具代表性的模式,这一过程缺乏通用原则并损害了轨迹精度。因此,我们受此启发引入了 ModeSeq,这是一种将模式建模为序列的新型多模态预测范式。与一次性解码多条合理轨迹的常见做法不同,ModeSeq 要求运动解码器逐步推断下一个模式,从而更明确地捕获模式之间的相关性,并显著增强推理多模态性的能力。利用序列模式预测的归纳偏置,我们还提出了早期匹配通吃 (EMTA) 训练策略以进一步增加轨迹的多样性。无需依赖密集模式预测或启发式后处理,ModeSeq 在获得令人满意的轨迹精度的同时,显著提高了多模态输出的多样性,在运动预测基准上取得了均衡的性能。此外,ModeSeq 自然涌现出模式外推能力,支持在未来高度不确定时预测更多行为模式。
引用
@article{arxiv.2411.11911,
title = {ModeSeq: Taming Sparse Multimodal Motion Prediction with Sequential Mode Modeling},
author = {Zikang Zhou and Hengjian Zhou and Haibo Hu and Zihao Wen and Jianping Wang and Yung-Hui Li and Yu-Kai Huang},
journal= {arXiv preprint arXiv:2411.11911},
year = {2025}
}
备注
CVPR 2025