中文

将不确定性转移至关键时刻:面向 VLA 模型的可靠不确定性量化

机器人学 2026-03-20 v1 人工智能 机器学习

摘要

视觉-语言-动作(VLA)模型通过将视觉观测和语言指令映射到低层动作,实现通用机器人策略,但往往缺乏可靠的内省能力。常见做法是计算 token 级别的不确定性信号并对整个 rollout 求平均。然而,平均聚合会稀释连续控制中短暂但可能危及安全的不确定性尖峰。在特定情况下,成功的 rollout 可能包含因良好噪声或非关键微调而产生的局部高熵段,而失败的 rollout 大多数时刻可能呈现低熵,仅在失败开始附近出现短暂尖峰。我们提出了一种统一的不确定性量化方法,用于预测 rollout 成功与否, (1) 使用基于最大值的最大池化保留瞬时风险信号, (2) 应用运动感知稳定性加权以强调与不稳定行为相关的高频动作振荡, (3) 通过贝叶斯优化实现自由度自适应校准以优先处理运动学关键轴。LIBERO 基准上的实验表明,我们的方法显著提高了失败预测准确性,为人机协同干预提供了更可靠的信号。

关键词

引用

@article{arxiv.2603.18342,
  title  = {Shifting Uncertainty to Critical Moments: Towards Reliable Uncertainty Quantification for VLA Model},
  author = {Yanchuan Tang and Taowen Wang and Yuefei Chen and Boxuan Zhang and Qiang Guan and Ruixiang Tang},
  journal= {arXiv preprint arXiv:2603.18342},
  year   = {2026}
}