用于多模态无人机目标检测的大语言模型引导渐进式特征对齐
计算机视觉与模式识别
2025-03-11 v1 人工智能
摘要
现有的多模态无人机(UAV)目标检测方法往往忽略了模态之间语义鸿沟的影响,这使得难以实现准确的语义和空间对齐,从而限制了检测性能。为了解决这个问题,我们提出了一种大语言模型(LLM)引导的渐进式特征对齐网络,称为 LPANet,它利用从大语言模型中提取的语义特征来指导多模态无人机目标检测中模态之间的渐进式语义和空间对齐。为了利用 LLM 强大的语义表示能力,我们通过 ChatGPT 生成每个目标类别的细粒度文本描述,然后使用大语言模型 MPNet 提取语义特征。基于这些语义特征,我们以如下渐进式方式指导语义和空间对齐。首先,我们设计了语义对齐模块(SAM),将每个目标的语义特征和多模态视觉特征拉近,缓解模态之间目标的语义差异。其次,我们通过将语义关系集成到特征级偏移估计中,设计了显式空间对齐模块(ESM),缓解模态之间粗略的空间错位。最后,我们设计了隐式空间对齐模块(ISM),利用跨模态相关性从相邻区域聚合关键特征,以实现隐式空间对齐。在两个公开的多模态无人机目标检测数据集上的综合实验表明,我们的方法优于 state-of-the-art 的多模态无人机目标检测器。
引用
@article{arxiv.2503.06948,
title = {Large Language Model Guided Progressive Feature Alignment for Multimodal UAV Object Detection},
author = {Wentao Wu and Chenglong Li and Xiao Wang and Bin Luo and Qi Liu},
journal= {arXiv preprint arXiv:2503.06948},
year = {2025}
}