通过多模态视觉序列变换器推进语义未来预测
计算机视觉与模式识别
2025-12-01 v2
摘要
语义未来预测对于在动态环境中导航的自主系统至关重要。本文介绍了FUTURIST,一种多模态未来语义预测方法,采用统一高效的视觉序列变换器架构。我们的方法结合了多模态掩码视觉建模目标和新颖的掩码机制,专为多模态训练设计。这使得模型能够有效整合来自不同模态的可见信息,提高预测精度。此外,我们提出了一种无VAE的分层标记化过程,降低了计算复杂度,简化了训练流程,并实现了高分辨率多模态输入的端到端训练。我们在Cityscapes数据集上验证了FUTURIST,在短期和中期预测的未来语义分割中均达到了最先进性能。项目页面和代码:https://futurist-cvpr2025.github.io/。
引用
@article{arxiv.2501.08303,
title = {Advancing Semantic Future Prediction through Multimodal Visual Sequence Transformers},
author = {Efstathios Karypidis and Ioannis Kakogeorgiou and Spyros Gidaris and Nikos Komodakis},
journal= {arXiv preprint arXiv:2501.08303},
year = {2025}
}
备注
CVPR 2025