中文

RefDrone:面向无人机场景指称表达理解的一个挑战性基准

计算机视觉与模式识别 2025-11-25 v3

摘要

无人机已成为应用广泛的机器人平台,在具身人工智能(Embodied AI)中展现出巨大潜力。指称表达理解(Referring Expression Comprehension, REC)使无人机能够根据自然语言表达定位物体,这是具身人工智能的一项关键能力。尽管地面场景的 REC 取得了进展,但空中视角引入了独特的挑战,包括变化的视点、遮挡和尺度变化。为弥补这一差距,我们引入了 RefDrone,一个面向无人机场景的 REC 基准。RefDrone 揭示了 REC 中的三个关键挑战:1) 多尺度和小尺度目标检测;2) 多目标和无目标样本;3) 具有丰富上下文表达的复杂环境。为了高效构建该数据集,我们开发了 RDAgent(基于多智能体系统的指称无人机标注框架),这是一个用于 REC 任务的半自动化标注工具。RDAgent 确保了高质量的上下文表达并降低了标注成本。此外,我们提出了 Number GroundingDINO (NGDINO),一种旨在处理多目标和无目标情况的新方法。NGDINO 显式地学习并利用表达中提及的目标数量。使用最先进 REC 方法进行的综合实验表明,NGDINO 在提出的 RefDrone 和现有的 gRefCOCO 数据集上都取得了优越的性能。数据集和代码已公开于 https://github.com/sunzc-sunny/refdrone。

关键词

引用

@article{arxiv.2502.00392,
  title  = {RefDrone: A Challenging Benchmark for Referring Expression Comprehension in Drone Scenes},
  author = {Zhichao Sun and Yepeng Liu and Zhiling Su and Huachao Zhu and Yuliang Gu and Yuda Zou and Zelong Liu and Gui-Song Xia and Bo Du and Yongchao Xu},
  journal= {arXiv preprint arXiv:2502.00392},
  year   = {2025}
}