中文

交互接地学习

机器学习 2021-07-15 v2 人工智能 机器学习

摘要

考虑一个假肢手臂,学习适应其用户的控制信号。我们针对这一新颖设定提出了交互接地学习(Interaction-Grounded Learning),其中学习者的目标是在没有接地或显式奖励的情况下与环境交互以优化其策略。此类问题避开了需要显式奖励的常见强化学习(RL)解决方案。学习智能体观察一个多维上下文向量,采取一个动作,然后观察一个多维反馈向量。该多维反馈向量没有显式奖励信息。为了成功,算法必须学习如何评估反馈向量以发现一个潜在奖励信号,并借此在无监督情况下为其策略接地。我们表明,在交互接地学习设定下,在某些自然假设下,学习者可以发现潜在奖励并为其策略接地以实现成功交互。我们提供了理论保证和概念验证的实证评估,以证明我们所提方法的有效性。

关键词

引用

@article{arxiv.2106.04887,
  title  = {Interaction-Grounded Learning},
  author = {Tengyang Xie and John Langford and Paul Mineiro and Ida Momennejad},
  journal= {arXiv preprint arXiv:2106.04887},
  year   = {2021}
}

备注

Published in ICML 2021