中文

FALCON:面向无人机动作识别的情境感知对象中心预训练

计算机视觉与模式识别 2026-03-09 v2 人工智能 机器学习 机器人学

摘要

我们提出FALCON,这是一种统一的自监督视频预训练方法,用于从原始RGB航空视频中进行无人机动作识别,推理阶段无需额外预处理。无人机视频存在严重的空间不平衡:大块杂乱背景占据视野,导致基于重构的预训练方法在无信息区域浪费容量,而未充分学习与动作相关的人体/目标线索。FALCON通过整合对象感知掩码自动编码与对象中心双向时程未来重构来解决此问题。仅使用检测信息进行预训练,我们构建对象先验,使其(i)在掩码时强制令牌可见性平衡,(ii)将重构监督集中在与动作相关的区域,防止被背景外观主导学习。为促进时序动态学习,我们进一步在对象中心监督区域内重构短时程和长时程未来内容,注入对噪声鲁棒的预测时序监督。跨无人机基准测试中,FALCON在ViT-B主干模型上在NEC-Drone上提升2.9%在top-1准确率,在UAV-Human上提升5.8%,同时实现比依赖重型测试时增强的监督方法快2倍至5倍的推理速度。

关键词

引用

@article{arxiv.2409.18300,
  title  = {FALCON: Future-Aware Learning with Contextual Object-Centric Pretraining for UAV Action Recognition},
  author = {Ruiqi Xian and Xiyang Wu and Tianrui Guan and Xijun Wang and Boqing Gong and Dinesh Manocha},
  journal= {arXiv preprint arXiv:2409.18300},
  year   = {2026}
}