中文

RAPTOR:面向实时高分辨率无人机视频预测的高效视频注意力

计算机视觉与模式识别 2025-12-30 v2

摘要

视频预测面临一个根本性三难ilemma:实现高分辨率和感知质量通常会牺牲实时速度,阻碍其在延迟关键应用中的使用。这一挑战在无人机在密集城市环境中尤为突出,因为必须从高分辨率图像中预见事件,这对于安全性不可妥协。现有方法依赖迭代生成(扩散、自回归模型)或二次复杂度注意力,无法在边缘硬件上满足这些严苛要求。为突破这一长期诱惑,我们引入 RAPTOR,一种实现实时高分辨率性能的视频预测架构。RAPTOR 的单次传递设计避免了迭代方法的误差累积和延迟。其核心创新是高效视频注意力(EVA),一种新的翻译模块,对时空建模进行因式分解。不采用对展平时空标记的 O((ST)2)O((ST)^2)O(ST)O(ST) 复杂度处理,而是沿空间(S)和时间(T)轴交替进行操作。这种因式分解将时间复杂度降低到 O(S+T)O(S + T),内存复杂度降低到 O(max(S,T))O(max(S, T)),使其能够在 5122512^2 分辨率及更高分辨率下进行全局上下文建模,直接在稠密特征图上进行无 patch-free 设计。辅以这一架构的是一个三阶段训练课程,逐步细化从粗糙结构到锐利且时序一致的细节的预测。实验表明,RAPTOR 是首个在 Jetson AGX Orin 上实现 5122512^2 视频超过 30 FPS 的预测器,在 UAVid、KTH 和自定义高分辨率数据集上在 PSNR、SSIM 和 LPIPS 上均取得新纪录。 critically,RAPTOR 在实际无人机导航任务中提升了任务成功率 18%,为更安全、更具前瞻性的具身智能体铺路。

关键词

引用

@article{arxiv.2512.21710,
  title  = {RAPTOR: Real-Time High-Resolution UAV Video Prediction with Efficient Video Attention},
  author = {Zhan Chen and Zile Guo and Enze Zhu and Peirong Zhang and Xiaoxuan Liu and Lei Wang and Yidan Zhang},
  journal= {arXiv preprint arXiv:2512.21710},
  year   = {2025}
}

备注

Accepted by AAAI2026