中文

基于视觉语言模型的多无人地面车对抗战术决策

人工智能 2025-07-16 v1

摘要

在多个无人地面车对抗场景中,自动从情境感知中演化的多智能体战术决策仍是重大挑战。传统的基于手工规则的方法在复杂且瞬时变化的战场环境中不稳健;当前强化学习方法主要关注动作操作,而非战略决策,由于缺乏可解释性。为此,我们提出一种基于视觉语言模型的指挥官,用于解决自主对抗中的智能感知到决策推理问题。该方法集成了用于场景理解的视觉语言模型和用于战略推理的轻量级大语言模型,实现了统一的感知与决策,位于共享语义空间中,具有强大的适应性和可解释性。与基于规则的搜索和强化学习方法不同,两模块的组合构成了完整的链条,反映了人类指挥官的认知过程。仿真和消融实验验证了该方法相对于基线模型实现了 80% 以上的胜率。

关键词

引用

@article{arxiv.2507.11079,
  title  = {Tactical Decision for Multi-UGV Confrontation with a Vision-Language Model-Based Commander},
  author = {Li Wang and Qizhen Wu and Lei Chen},
  journal= {arXiv preprint arXiv:2507.11079},
  year   = {2025}
}