STRAPPER:基于自训练增强与同伴正则化的偏好式强化学习
机器学习
2023-07-20 v1 人工智能
摘要
基于偏好的强化学习(PbRL)有望通过二元人类偏好学习复杂的奖励函数。然而,这种人在回路的范式需要大量人力为片段对标注偏好标签,阻碍了其大规模应用。近期方法尝试复用未标注片段,隐式阐明片段分布从而缓解人力负担,并进一步引入一致性正则化以提升半监督学习性能。但我们注意到,与一般分类任务不同,PbRL中存在一种独特现象,本文称之为相似性陷阱。直观上,人类对相似片段对可能有截然相反的偏好,而这种相似性可能使一致性正则化在PbRL中失效。由于相似性陷阱的存在,此类一致性正则化不当地增强了模型对片段对预测间的一致可能性,从而降低奖励学习的置信度,因为增强分布与PbRL中原始分布不匹配。为克服该问题,我们提出一种自训练方法并配合所提出的同伴正则化,其惩罚奖励模型记忆无信息标签并获取置信预测。实证上,我们证明了该方法能够利用不同半监督替代方案与同伴正则化,良好地学习多种运动与机器人操控行为。
引用
@article{arxiv.2307.09692,
title = {STRAPPER: Preference-based Reinforcement Learning via Self-training Augmentation and Peer Regularization},
author = {Yachen Kang and Li He and Jinxin Liu and Zifeng Zhuang and Donglin Wang},
journal= {arXiv preprint arXiv:2307.09692},
year = {2023}
}