中文

基于 BLIP-2 的无人机视频理解边缘优化多模态学习

计算机视觉与模式识别 2026-01-14 v1 机器人学

摘要

在复杂场景中实现实时视觉理解与交互的需求对无人机(UAV)日益关键。然而,大视觉语言模型的高计算成本与无人机边缘设备上有限的计算资源之间的矛盾带来了重大挑战。为应对这一挑战,本文提出了一种基于 BLIP-2 的轻量级多模态任务平台,并与 YOLO-World 和 YOLOv8-Seg 模型相集成。该集成以最小的适配扩展了 BLIP-2 在无人机应用中的多任务能力,且无需在无人机数据上进行特定任务的微调。首先,BLIP-2 与 YOLO 模型的深度融合使其能够利用 YOLO 在目标检测和实例分割等基础任务上的精确感知结果,从而促进更深层的视觉注意力理解与推理。其次,设计了一种基于 K-Means 聚类的内容感知关键帧采样机制,该机制结合了智能帧选择和时间特征拼接。这为轻量级 BLIP-2 架构配备了有效处理视频级交互任务的能力。第三,实现了用于多任务适配的统一提示优化方案。该方案将来自 YOLO 模型的结构化事件日志作为上下文信息策略性地注入 BLIP-2 的输入中。结合旨在过滤技术细节的输出约束,该方法有效地引导模型为各种任务生成准确且与上下文相关的输出。

关键词

引用

@article{arxiv.2601.08408,
  title  = {Edge-Optimized Multimodal Learning for UAV Video Understanding via BLIP-2},
  author = {Yizhan Feng and Hichem Snoussi and Jing Teng and Jian Liu and Yuyang Wang and Abel Cherouat and Tian Wang},
  journal= {arXiv preprint arXiv:2601.08408},
  year   = {2026}
}

备注

The Tenth International Conference on Data Mining and Big Data (DMBD'2025)