中文

关于学习而非假设人类偏差进行奖励推断的可行性

机器学习 2019-06-25 v1 人工智能 机器学习

摘要

我们的目标是让智能体优化正确的奖励函数,尽管我们很难明确指定它是什么。逆强化学习(IRL)使我们能从演示中推断奖励函数,但它通常假设专家是带噪声的最优者。另一方面,真实人类常有系统性偏差:风险厌恶、短视等。一种选择是尝试刻画这些偏差并在学习中显式地加以考虑。但在深度学习时代,研究者自然提出的建议是避免充满特定假设的人类行为数学模型,转而使用纯数据驱动方法。我们决定对此进行检验——而非依赖关于演示者在规划时具有何种特定偏差的假设,我们改为将其用于生成演示的规划算法学习为一个可微规划器。我们的探索得出喜忧参半的发现:一方面,学习规划器比依赖错误假设能带来更好的奖励推断;另一方面,这一收益与我们因从精确规划器转向可微规划器所遭受的损失相比微不足道。这表明至少在可预见的未来,智能体需要在数据驱动方法的灵活性与已知人类偏差的有用性之间取得折中。代码见 https://tinyurl.com/learningbiases。

关键词

引用

@article{arxiv.1906.09624,
  title  = {On the Feasibility of Learning, Rather than Assuming, Human Biases for Reward Inference},
  author = {Rohin Shah and Noah Gundotra and Pieter Abbeel and Anca D. Dragan},
  journal= {arXiv preprint arXiv:1906.09624},
  year   = {2019}
}

备注

Published at ICML 2019