中文

空中照片上的通用指代表达式分割

计算机视觉与模式识别 2025-12-09 v1

摘要

指代表达式分割是计算机视觉中的基础任务,将自然语言理解与目标区域的精确视觉定位相结合。考虑到空中图像(如无人机采集的现代航拍照、航空档案中的历史照片、高分辨率卫星图像等)具有独特挑战:空间分辨率在数据集间差异很大,颜色使用不一致,目标常缩小至仅几像素,场景包含极高的目标密度和部分遮挡的目标。本工作提出Aerial-D,一个面向空中图像的大规模指代表达式分割数据集,包含37,288张图像,1,522,523个指代表达式,覆盖259,709个标注目标,跨越单个目标实例、多个实例组合并涵盖21个类别,包括车辆、基础设施和土地覆盖类型等。该数据集通过完全自动化的管道构建,结合系统化的规则表达式生成与大型语言模型(LLM)增强程序,丰富了语言多样性并聚焦指代表达式中的视觉细节。 additionally使用了过滤器来模拟每个场景的历史成像条件。我们采用RSRefSeg架构,在Aerial-D上训练模型并与先前的空中数据集联合训练,实现从文本到图像的统一实例和语义分割,适用于现代和历史图像。结果表明,联合训练在当代基准上实现竞争性能,同时在单色、亚马逊和颗粒噪声退化下保持较高准确率,这些退化常见于档案航空摄影。数据集、训练好的模型和完整的软件管道已公开发布于https://luispl77.github.io/aerial-d。

关键词

引用

@article{arxiv.2512.07338,
  title  = {Generalized Referring Expression Segmentation on Aerial Photos},
  author = {Luís Marnoto and Alexandre Bernardino and Bruno Martins},
  journal= {arXiv preprint arXiv:2512.07338},
  year   = {2025}
}

备注

Submitted to IEEE J-STARS