面向人类在环偏好对齐的无人机河流视觉导航部署方案
机器人学
2025-11-04 v1
摘要
河流是环境监测和灾害响应的关键走廊,通过由视觉驱动的策略指导的无人机(UAV)可提供快速、低成本的覆盖。然而,部署会暴露分布迁移和安全风险的仿真训练策略,并需要从有限的人类干预中高效适应。我们研究了与保守监督者(veto 不安全或低效动作并通过比较代理提议与纠正性覆盖来提供状态级偏好)合作的人类在环(HITL)学习。我们引入了机器人学状态混合偏好对齐(SPAR-H),该方法融合对策略logit的直接偏好优化与基于奖励的路径方法,后者从相同偏好中训练即时奖励估�器并使用信任区间代理更新策略。在五次固定初级策略下的HITL rollout中,SPAR-H 在最终episodic奖励和初始条件方差方面均优于所测试的方法。所学奖励模型与人类偏好动作一致,并提升附近未干预的选择,支持改进的稳定传播。我们将SPAR-H与模仿学习(IL)、直接偏好变体以及评估型强化学习(RL)在HITL环境中进行基准测试,展示了UAV河流跟随的持续偏好对齐在实际中的可行性。总体而言,双状态级偏好在河流导航中提供了数据高效在线适应的实用途径。
引用
@article{arxiv.2511.01083,
title = {Deployable Vision-driven UAV River Navigation via Human-in-the-loop Preference Alignment},
author = {Zihan Wang and Jianwen Li and Li-Fan Wu and Nina Mahmoudian},
journal= {arXiv preprint arXiv:2511.01083},
year = {2025}
}
备注
Submitted to ICRA 2026