纠错逆强化学习中的特征表示诊断与增强
机器人学
2023-04-14 v2 系统与控制
系统与控制
摘要
机器人通过从人类反馈中学习来为其执行任务已日益熟练,但由于缺失或错误学习的特征,仍常遭受模型不对齐之苦。当机器人完成任务所需学习的特征缺失或不能很好地泛化到新环境时,机器人将无法学习人类期望的任务,更糟的是,可能学到完全不同且不受欢迎的行为。先前工作展示了机器人如何检测其表示缺失某些特征,从而可请求人类教导新特征;然而,这些工作未区分完全缺失的特征与那些存在但不能泛化到新环境的特征。在后一种情况下,机器人将检测不对齐并简单地学习新特征,导致特征表示任意增长,进而可能引发虚假关联与后续的错误学习。在本工作中,我们提出分离这两种不对齐来源:我们提出一个框架,用于判定机器人所需特征是错误学习且不能泛化到新环境设置,还是完全缺失于机器人表示中。一旦检测到错误来源,我们展示人类如何启动模型的对齐过程:若特征缺失,我们遵循先前工作学习新特征;但若特征存在但不能泛化,我们使用数据增强来扩展其训练,从而完成纠正。我们在配备模拟 7DoF 机器人机械臂与物理人类纠正的实验中演示了所提方法。
引用
@article{arxiv.2304.05238,
title = {Diagnosing and Augmenting Feature Representations in Correctional Inverse Reinforcement Learning},
author = {Inês Lourenço and Andreea Bobu and Cristian R. Rojas and Bo Wahlberg},
journal= {arXiv preprint arXiv:2304.05238},
year = {2023}
}
备注
8 pages, 4 figures