中文

嵌入航拍影像的多模态数学推理:基准构建、分析与探索

计算机视觉与模式识别 2025-09-15 v1 人工智能

摘要

数学推理对于基于无人机的遥感任务(如精确的距离与面积计算、轨迹估计和空间分析)至关重要,然而当前的视觉-语言模型(VLMs)尚未在该领域得到充分测试。为填补这一空白,我们引入了 AVI-Math,这是首个严格评估航拍影像中多模态数学推理的基准,它超越了简单的计数任务,涵盖了几何、逻辑和代数等领域的特定知识。该数据集包含 3,773 个从无人机视角捕获的高质量车辆相关问题,覆盖 6 个数学学科和 20 个主题。数据在不同高度和多个无人机角度下采集,反映了真实的无人机场景,确保了所构建数学问题的多样性和复杂性。本文对 14 个主流 VLM 进行了全面评估,结果表明,尽管这些模型在以往的多模态基准上取得了成功,但在 AVI-Math 的推理任务中表现不佳。我们的详细分析揭示了当前 VLM 在数学推理能力上的显著局限,并为未来研究指明了方向。此外,我们探索了思维链提示和微调技术,这些技术在应对 AVI-Math 中的推理挑战方面展现出潜力。我们的发现不仅暴露了 VLM 在数学推理方面的不足,也为在实际应用中推进基于无人机的可信 VLM 提供了宝贵见解。代码和数据集将在 https://github.com/VisionXLab/avi-math 发布。

关键词

引用

@article{arxiv.2509.10059,
  title  = {Multimodal Mathematical Reasoning Embedded in Aerial Vehicle Imagery: Benchmarking, Analysis, and Exploration},
  author = {Yue Zhou and Litong Feng and Mengcheng Lan and Xue Yang and Qingyun Li and Yiping Ke and Xue Jiang and Wayne Zhang},
  journal= {arXiv preprint arXiv:2509.10059},
  year   = {2025}
}

备注

17 pages, 16 figures