中文

面向人机交互的基于视觉语言模型的早期动作预测的决策感知不确定性评估

机器人学 2026-03-13 v2

摘要

在共享工作空间中的机器人必须从部分、模糊的观察中解释人类动作,其中过于自信的早期预测可能导致不安全或干扰性的交互。由于视角变化和遮挡增加了感知噪声和模糊性,这一挑战在 egocentric 视图中尤为突出。结果是,下游人机交互模块需要不仅获取动作假设,还需可靠估计部分观察下的置信度。最近的基于视觉语言模型的方法已用于短期动作识别,由于其开放词汇和上下文感知推理能力,但其在时序前缀语境下的不确定性可靠性尚未得到系统性评估。我们首次系统性评估了基于视觉语言模型的短期动作识别中的不确定性,用于人机交互。我们引入时序前缀评估协议和指标,用于校准和选择性预测。我们还描述了在部分观察下的误校准模式和失效模式。我们的研究提供了使用视觉语言模型预测进行置信度加控人机交互模块所需的缺失可靠性证据。

关键词

引用

@article{arxiv.2603.10061,
  title  = {Decision-Aware Uncertainty Evaluation of Vision-Language Model-Based Early Action Anticipation for Human-Robot Interaction},
  author = {Zhaoda Du and Michael Bowman and Qiaojie Zheng and Xiaoli Zhang},
  journal= {arXiv preprint arXiv:2603.10061},
  year   = {2026}
}