中文

利用反事实解释加速TAMER的学习

人工智能 2022-07-28 v2 机器学习

摘要

能够交互式地从人类反馈中学习将使智能体在新环境中发挥作用。例如,即使是新手用户也可以自然且交互地训练服务机器人执行新任务。人在回路强化学习(HRL)结合了人类反馈和强化学习(RL)技术。最先进的交互式学习技术存在学习速度慢的问题,从而导致人类体验不佳。我们通过扩展用于评估反馈的HRL框架TAMER来解决这个问题,该扩展允许用两种不同类型的反事实解释(基于动作和基于状态)来增强人类反馈。我们通过实验表明,我们的扩展提高了学习速度。

关键词

引用

@article{arxiv.2108.01358,
  title  = {Accelerating the Learning of TAMER with Counterfactual Explanations},
  author = {Jakob Karalus and Felix Lindner},
  journal= {arXiv preprint arXiv:2108.01358},
  year   = {2022}
}