中文

CHOP:利用反事实人类偏好标签改善视觉运动导航策略中的障碍规避

机器人学 2026-03-03 v1

摘要

视觉运动导航策略已显示出强大的感知-动作耦合,但在复杂真实环境中常在安全导航和动态障碍规避方面受限。我们提出 CHOP,一种新方法,利用反事实人类偏好标签 (Counterfactual Human Preference Labels) 将视觉运动导航策略对齐至人类对安全与障碍规避的直觉。在 CHOP 中,针对每个视觉观测,机器人执行的轨迹被包含在一组反事实导航轨迹中:在相同条件下机器人可能遵循的备选轨迹。人类标注员根据预期结果(如碰撞风险和路径效率)对这些轨迹进行两两偏好标注。这些汇总的偏好随后用于微调视觉运动导航策略,使其在导航中与人类偏好保持一致。SCAND 数据集上的实验表明,与预训练基线相比,采用 CHOP 微调的视觉运动导航策略在近碰撞事件上减少 49.7%,偏离人类偏好轨迹降低 45.0%,平均障碍间隙提高 19.8%。在 Ghost Robotics Vision60 四足机器人上的实际部署中,CHOP 对齐的策略使平均目标成功率提高 24.4%,最小障碍间隙提升 6.8%,碰撞和干预事件减少 45.7%,平均归一化路径完成度提高 38.6%。我们的结果凸显了反事实偏好监督在弥合大规模视觉运动策略与人类对齐安全感知导航之间的价值。

关键词

引用

@article{arxiv.2603.02004,
  title  = {CHOP: Counterfactual Human Preference Labels Improve Obstacle Avoidance in Visuomotor Navigation Policies},
  author = {Gershom Seneviratne and Jianyu An and Vaibhav Shende and Sahire Ellahy and Yaxita Amin and Kondapi Manasanjani and Samarth Chopra and Jonathan Deepak Kannan and Dinesh Manocha},
  journal= {arXiv preprint arXiv:2603.02004},
  year   = {2026}
}