通过人类互动进行推理时策略引导
机器人学
2025-03-27 v2 人工智能
人机交互
机器学习
摘要
使用人类演示训练的生成式策略能够自主完成多模态、长期程度的任务。然而,在推理期间,人类常被从策略执行循环中移除,限制了在多种预测结果中将预训练策略引导 toward 特定子目标或轨迹形状的能力。朴素的人类干预可能不可避免地加剧分布偏移,导致约束违反或执行失败。为更好地在不引发分布外错误的情况下将策略输出与人类意图对齐,我们提出一种推理时策略引导(ITPS)框架,该框架利用人类互动来偏向生成式采样过程,而非对互动数据进行微调。我们在三个模拟和真实世界基准上评估了ITPS,测试了三种形式的人类互动及其相关对齐距离度量。在六种采样策略中,我们提出的基于扩散策略的随机采样在对齐性和分布偏移之间实现了最佳权衡。视频可在https://yanweiw.github.io/itps/上访问。
引用
@article{arxiv.2411.16627,
title = {Inference-Time Policy Steering through Human Interactions},
author = {Yanwei Wang and Lirui Wang and Yilun Du and Balakumar Sundaralingam and Xuning Yang and Yu-Wei Chao and Claudia Perez-D'Arpino and Dieter Fox and Julie Shah},
journal= {arXiv preprint arXiv:2411.16627},
year = {2025}
}
备注
ICRA 2025