Sign Language:迈向用于机器人自主性的标识理解
机器人学
2025-09-17 v2
摘要
导航标识是人类寻路和场景理解的常见辅助工具,但尚未被机器人充分利用。我们认为,通过直接编码有关动作、空间区域和关系的特权信息,它们能使机器人导航和场景理解受益。由于场景和标识的复杂性,在开放世界环境中解释标识仍然是一项挑战,但视觉语言模型(VLM)的最新进展使这成为可能。为了推进该领域的进展,我们引入了导航标识理解任务,该任务从标识中解析位置及相关方向。我们为此任务提供了一个基准,提出了适当的评估指标,并策划了一个测试集,该测试集涵盖了从医院到购物中心再到交通枢纽等各种公共空间中具有不同复杂度和设计的标识。我们还提供了一种使用 VLM 的基线方法,并展示了它们在导航标识理解方面的潜力。代码和数据集可在 Github 上获取。
引用
@article{arxiv.2506.02556,
title = {Sign Language: Towards Sign Understanding for Robot Autonomy},
author = {Ayush Agrawal and Joel Loo and Nicky Zimmerman and David Hsu},
journal= {arXiv preprint arXiv:2506.02556},
year = {2025}
}
备注
This work has been submitted to the IEEE for possible publication