借助部分确定性:建筑环境中机器人场景识别的 conformal 预测
计算机视觉与模式识别
2025-01-10 v1
摘要
在为残障人士服务的协作机器人中,准确的建筑环境中的地点识别至关重要,以确保机器人在多样化室内空间中安全导航和交互。大型语言模型 (LLM) 和视觉语言模型 (VLM) 驱动的语言界面在此背景下具有巨大的潜力,因为它们能够解释视觉场景并将其与语义信息相关联。然而,这些界面也因生成幻觉预测而知名。此外,人类提供的语言指令也可能模糊且缺乏关于特定位置、物体或操作的精确细节,加剧了幻觉问题。本文引入一种名为“借助部分确定性” (Seeing with Partial Certainty, SwPC) 的框架,用于衡量和对齐 VLM 基于地点识别的不确定性,使模型能够识别自身缺乏信心的情形并在必要时寻求帮助。该框架基于 conformal 预测理论,提供地点识别的统计保证,同时在复杂室内环境设置下最小化对人类帮助的请求。通过在广泛使用丰富标注场景数据集 Matterport3D 上的实验,我们展示 SwPC 显著提高了成功率,降低了对人类干预的需求。SwPC 可直接与任何 VLM 配合使用,无需模型微调,为一种承诺且轻量级的不确定性建模方法,能够与基础模型不断扩大的能力相伴随扩展。
引用
@article{arxiv.2501.04947,
title = {Seeing with Partial Certainty: Conformal Prediction for Robotic Scene Recognition in Built Environments},
author = {Yifan Xu and Vineet Kamat and Carol Menassa},
journal= {arXiv preprint arXiv:2501.04947},
year = {2025}
}
备注
10 pages, 4 Figures