利用屏蔽机制纳入人类偏好与解释以提升强化学习的透明性
机器人学
2023-11-29 v1
摘要
强化学习(RL)在若干以人为中心应用中的采用,使机器人具备基于运行环境观测的自主决策能力与适应性。然而,在此类场景中,学习过程可能使机器人行为对人类而言不清晰且不可预测,从而阻碍顺畅有效的人机交互(HRI)。因此,避免机器人执行对用户不清晰的动作变得至关重要。本工作中,我们探究在 RL 中纳入人类偏好(关于机器人学习期间执行的动作)是否可提升机器人行为的透明性。为此,在 RL 算法中引入屏蔽机制以纳入人类偏好并监控学习智能体的决策。我们开展了涉及 26 名参与者的被试内研究,在不同设置下从可辨识性、可预测性与可预期性评估机器人透明性。结果表明,在学习期间考虑人类偏好相较仅提供解释改善了可辨识性,而将人类偏好与阐明机器人决策背后理由的解释相结合进一步增强了透明性。结果也确认透明性的提升带来了机器人安全性、舒适性与可靠性的提高。这些发现显示了学习期间透明性的重要性,并提出了一种人在回路的机器人应用范式。
引用
@article{arxiv.2311.16838,
title = {Increasing Transparency of Reinforcement Learning using Shielding for Human Preferences and Explanations},
author = {Georgios Angelopoulos and Luigi Mangiacapra and Alessandra Rossi and Claudia Di Napoli and Silvia Rossi},
journal= {arXiv preprint arXiv:2311.16838},
year = {2023}
}