中文

GENNAV:通用指引可导航区域的多边形掩码生成

计算机视觉与模式识别 2025-09-01 v1 机器人学

摘要

我们聚焦于从自然语言指令和由移动设备捕获的前置摄像头图像中识别目标区域位置的任务。该任务具有挑战性,因为它需要进行存在预测和分割,尤其是对于边界模糊的类目型目标区域。现有方法在处理类目型目标区域方面表现不佳,此外还存在目标缺失或多个目标的问题。为克服这些限制,我们提出 GENNAV,该模型预测目标是否存在并为多个类目型目标区域生成分割掩码。为评估 GENNAV,我们构建了一个新基准 GRiN-Drive,包括三种不同类型的样本:无目标、单目标和多目标。GENNAV 在标准评估指标上优于基线方法。此外,我们在四辆汽车中进行了实验,分别在五个地理上不同的城市区域进行验证,以验证其零样本迁移性能。在这些实验中,GENNAV 优于基线方法,并在多样化的真实环境中展现出良好的鲁棒性。项目页面地址为 https://gennav.vercel.app/。

关键词

引用

@article{arxiv.2508.21102,
  title  = {GENNAV: Polygon Mask Generation for Generalized Referring Navigable Regions},
  author = {Kei Katsumata and Yui Iioka and Naoki Hosomi and Teruhisa Misu and Kentaro Yamada and Komei Sugiura},
  journal= {arXiv preprint arXiv:2508.21102},
  year   = {2025}
}

备注

Accepted for presentation at CoRL2025