3D指令歧义检测
人工智能
2026-04-16 v2
摘要
在安全关键领域,语言歧义可能导致严重后果;例如,在外科手术环境中,一个模糊的指令如“把瓶子递给我”可能导致灾难性错误。然而,大多数具身AI研究忽视了这一点,假设指令是清晰的,并侧重于执行而非确认。为了解决这一关键的安全缺口,我们首次定义了3D指令歧义检测,这是一个基础性的新任务,要求模型判断在给定的3D场景中,一个命令是否具有单一、明确的含义。为了支持这项研究,我们构建了Ambi3D,这是一个用于此任务的大规模基准,包含超过700个多样化的3D场景和约22k条指令。我们的分析揭示了一个令人惊讶的局限性:最先进的3D大语言模型(LLMs)难以可靠地判断一条指令是否具有歧义。为了应对这一挑战,我们提出了AmbiVer,这是一个两阶段框架,它从多个视角收集显式的视觉证据,并利用这些证据指导一个视觉-语言模型(VLM)判断指令歧义。大量实验证明了我们任务的挑战性以及AmbiVer的有效性,为更安全、更可信的具身智能铺平了道路。代码和数据集可在https://jiayuding031020.github.io/ambi3d/获取。
引用
@article{arxiv.2601.05991,
title = {3D Instruction Ambiguity Detection},
author = {Jiayu Ding and Haoran Tang and Hongbo Jin and Wei Gao and Ge Li},
journal= {arXiv preprint arXiv:2601.05991},
year = {2026}
}