MANTA: 高效且有效的扩散 Mamba 用于随机长期稠密预测
计算机视觉与模式识别
2025-03-24 v2
摘要
长期稠密动作预测非常具有挑战性,因为需要基于提供的视频观察结果,预测数分钟后动作及其持续时间。为建模未来结果的不确定性,随机模型会预测同一观察的多个潜在动作序列。最近的工作进一步提出在观察帧上同时预测每帧的过去和未来动作,以融合不确定性建模。虽然这种动作的联合建模有益,但需要长程时间的能力以跨越遥远的过去和未来时间点。然而,前述工作由于其受限或稀疏的感受野,难以实现这种长程理解。为缓解此问题,我们提出一种新型 MANTA(MAmba for ANTicipation)网络。我们的模型即使在非常长的序列上,仍能有效地进行长期时间建模,同时保持序列长度的线性复杂度。我们展示了该方法在三个数据集 - Breakfast、50Salads 和 Assembly101 - 上实现了最好的性能,并且显著提高了计算和内存效率。我们的代码可在 https://github.com/olga-zats/DIFF_MANTA 查阅。
引用
@article{arxiv.2501.08837,
title = {MANTA: Diffusion Mamba for Efficient and Effective Stochastic Long-Term Dense Anticipation},
author = {Olga Zatsarynna and Emad Bahrami and Yazan Abu Farha and Gianpiero Francesca and Juergen Gall},
journal= {arXiv preprint arXiv:2501.08837},
year = {2025}
}
备注
Accepted to CVPR2025