如何用刀削:对细粒度操控与人类偏好的对齐
机器人学
2026-03-04 v1 人工智能
计算机视觉与模式识别
机器学习
系统与控制
系统与控制
摘要
许多关键操控任务——如食物准备、手术和手工艺——至今仍难以实现自动化。这些任务的特点不仅是接触丰富、力感知的动力学,还具有“隐式”成功标准:与其抓取-放置不同,任务质量在这些领域是连续且主观的(例如土豆削得多好),这使得量化评估和奖励工程困难。我们提出一种学习框架来解决此类问题,以用刀削土豆作为代表性案例。我们的方法采用两阶段流程:首先,通过力感知数据收集和模仿学习获取稳健的初始策略,实现跨对象变体的泛化;其次,通过结合量化任务指标和定性人类反馈的学习奖励模型,对策略进行偏好基准的微调,将策略行为与人类对任务质量的理解对齐。仅使用 50-200 条削土豆轨迹,我们的系统在包括黄瓜、苹果和土豆在内的具有挑战性的食材上实现了超过 90% 的平均成功率,经过偏好微调后性能提升最高可达 40%。令人惊讶的是,在单一食材类别上训练的策略,对未见的同类实例以及来自不同类别的 out-of-distribution 食材,都表现出强大的零样本泛化能力,保持超过 90% 的成功率。
引用
@article{arxiv.2603.03280,
title = {How to Peel with a Knife: Aligning Fine-Grained Manipulation with Human Preference},
author = {Toru Lin and Shuying Deng and Zhao-Heng Yin and Pieter Abbeel and Jitendra Malik},
journal= {arXiv preprint arXiv:2603.03280},
year = {2026}
}
备注
Project page can be found at https://toruowo.github.io/peel