在保持用户隐私的同时微调机器人策略
机器人学
2026-03-05 v2
摘要
近期研究提出了通用机器人策略。这些策略为机器人应如何行为提供了强有力的先验——例如机械臂应如何操作食物物品。但为了使机器人匹配个人的需求,用户通常需要微调这些通用策略——例如向机械臂展示如何制作他们偏好的晚餐。重要的是,在个性化机器人的过程中,最终用户会泄露关于其偏好、习惯和风格的数据(例如他们偏好的食物)。其他代理只需运行微调后的策略即可观察到这些个人训练行为。这带来了一个根本性挑战:我们如何开发能够在保持学习过程对外部代理保密的同时实现个性化行为的机器人?在此我们探索了人机交互中的这一新兴主题,并开发了PRoP,一个用于个性化和私有化机器人策略的模型无关框架。我们的核心思想是为每位用户配备一个唯一的密钥;该密钥随后用于数学变换机器人网络的权重。使用正确的密钥时,机器人策略切换以匹配该用户的偏好——但使用错误密钥时,机器人恢复其基线行为。我们展示了该方法在模仿学习、强化学习和分类任务中多种模型类型上的通用适用性。PRoP具有实际优势,因为它保留了原始策略的架构和行为,并且在实验上优于现有的基于编码器的方法。
引用
@article{arxiv.2509.18311,
title = {Fine-Tuning Robot Policies While Maintaining User Privacy},
author = {Benjamin A. Christie and Sagar Parekh and Dylan P. Losey},
journal= {arXiv preprint arXiv:2509.18311},
year = {2026}
}