面向人在回路中强化学习智能体的建议一致性验证
人工智能
2022-10-10 v1
摘要
人在回路(HiL)强化学习在具有大动作与状态空间以及稀疏奖励的领域中日渐受到关注,其通过允许智能体接受来自 HiL 的建议来实现。除采纳建议外,序贯决策智能体还必须能够表达其在多大程度上利用了人类建议。随后,智能体应提供一种手段,供 HiL 检视其为整体环境目标而不得不拒绝的建议部分。我们引入建议一致性验证问题,该问题要求强化学习(RL)智能体向回路中的人类提供关于其建议被遵从程度的保证。我们进而提出一种基于树的通用语言(lingua-franca)来支持此通信,称为偏好树(Preference Tree)。我们在 MuJoCo 的 Humanoid 环境中研究了好建议与坏建议两种情形。通过实验,我们表明所提方法能够通过传达智能体是否正在使用人类建议,提供解决建议一致性验证问题的可解释手段。最后,我们呈现了一项有 20 名参与者的人类用户研究,验证了我们的方法。
引用
@article{arxiv.2210.03455,
title = {Advice Conformance Verification by Reinforcement Learning agents for Human-in-the-Loop},
author = {Mudit Verma and Ayush Kharkwal and Subbarao Kambhampati},
journal= {arXiv preprint arXiv:2210.03455},
year = {2022}
}
备注
Accepted at IROS-RLCONFORM 2022