诊断、反馈、适应:一种用于测试时策略适应的人机协同框架
机器学习
2023-07-20 v2 人工智能
人机交互
机器人学
摘要
策略常因分布偏移而失败——即当策略部署于新环境时,状态与奖励发生变化。数据增强可通过使模型对智能体观测中任务无关的变化保持不变来增强鲁棒性。然而,设计者事先并不知道哪些概念是无关的,尤其当不同终端用户对任务执行方式具有不同偏好时。我们提出一种交互式框架,直接利用来自用户的反馈来识别个性化的任务无关概念。我们的核心思想是生成反事实演示,使用户能快速识别可能的任务相关与无关概念。随后,任务无关概念的知识被用于执行数据增强,从而获得适应个性化用户目标的策略。我们给出了在离散与连续控制任务上结合真实人类用户的实验以验证框架。我们的方法(1)使用户更好地理解智能体失败,(2)减少了微调所需的演示数量,(3)将智能体对齐至个体用户的任务偏好。
引用
@article{arxiv.2307.06333,
title = {Diagnosis, Feedback, Adaptation: A Human-in-the-Loop Framework for Test-Time Policy Adaptation},
author = {Andi Peng and Aviv Netanyahu and Mark Ho and Tianmin Shu and Andreea Bobu and Julie Shah and Pulkit Agrawal},
journal= {arXiv preprint arXiv:2307.06333},
year = {2023}
}
备注
International Conference on Machine Learning (ICML) 2023