合成战链:面向边缘设备的零样本目标验证与战术推理框架
计算机视觉与模式识别
2026-02-17 v1 人工智能
机器人学
摘要
在动态军事环境中部署自主边缘机器人受限于稀缺的领域特定训练数据以及边缘硬件的计算限制。本文引入了层次化的零样本框架,将轻量级目标检测与来自 Qwen 和 Gemma 家族(4B-12B 参数)的紧凑型视觉语言模型(VLM)级联。Grounded DINO 作为高召回率、可文本提示的区域提议器,检测置信度高的帧传递给边缘端 VLM 进行语义验证。我们在 55 组来自《战场6》的高保真合成视频上评估了该流程,涵盖三项任务:误报过滤(最高可达 100% 准确率)、损伤评估(最高可达 97.5%)以及细粒度车辆分类(55%-90%)。我们进一步将该流程扩展为无代理 Scout-Commander 工作流程,实现 100% 正确的资产部署,GPT-4o 评分得分为 9.8/10,延迟低于 75 秒。一种新的“受控输入”方法将感知与推理解耦,揭示了 distinct 的失败表现型:Gemma3-12B 在战术逻辑方面表现出色,但在视觉感知方面失败,而 Gemma3-4B 在准确输入的情况下仍出现推理崩溃。这些发现验证了面向边缘自主性的层次化零样本架构,并为在安全关键应用中认证 VLM 适用性提供了诊断框架。
引用
@article{arxiv.2602.13324,
title = {Synthesizing the Kill Chain: A Zero-Shot Framework for Target Verification and Tactical Reasoning on the Edge},
author = {Jesse Barkley and Abraham George and Amir Barati Farimani},
journal= {arXiv preprint arXiv:2602.13324},
year = {2026}
}
备注
8 Pages, 3 Figures