误别!视觉-语言导航指令错误的检测与定位
机器人学
2025-01-16 v2 人工智能
计算与语言
摘要
持续环境下的视觉-语言导航(VLN-CE)是最直观且最具挑战性的具身 AI 任务之一。agent 需要通过执行一系列低层动作来导航至目标 goal,跟随一系列自然语言指令。所有 VLN-CE 方法都假设语言指令准确。然而,实际情况下,人类在描述空间环境时可能因记忆不准确或混淆而包含错误。当前 VLN-CE 基准未解决此情境,使得 state-of-the-art VLN-CE 方法在面对来自 human user 的 errant instructions 时变得脆弱。我们首次提出一种新型 benchmark 数据集,引入各种类型的 instruction 错误,考虑潜在的 human 原因。该基准为持续环境中 VLN 系统的鲁棒性提供了宝贵见解。在我们基准上评估 state-of-the-art VLN-CE 方法时,成功率(Success Rate)会下降最高可达 -25%。此外,我们正式定义了 Instruction Error Detection and Localization 任务,并在基准数据集之上建立了评估协议。我们还提出一种有效方法,基于 cross-modal transformer architecture,实现了在 error detection 和 localization 方面相较于基线的最佳性能。令人惊讶的是,我们提出的方法揭示了两个常用 VLN-CE 数据集(R2R-CE 和 RxR-CE)验证集中的错误,展示了该技术在其他任务中的实用性。代码和数据集均可在 https://intelligolabs.github.io/R2RIE-CE 获取。
引用
@article{arxiv.2403.10700,
title = {Mind the Error! Detection and Localization of Instruction Errors in Vision-and-Language Navigation},
author = {Francesco Taioli and Stefano Rosa and Alberto Castellini and Lorenzo Natale and Alessio Del Bue and Alessandro Farinelli and Marco Cristani and Yiming Wang},
journal= {arXiv preprint arXiv:2403.10700},
year = {2025}
}
备注
3 figures, 8 pages. Accepted at IROS'24