中文

因果性坎贝尔-古德哈特定律与强化学习

机器学习 2021-02-19 v2 人工智能 综合经济学 经济学

摘要

坎贝尔-古德哈特定律涉及一类因果推断错误,即决策主体旨在影响与其目标相关但不可靠地导致其目标的变量。这是经济学与政治科学中众所周知的错误,但在人工智能研究中并未被广泛标识。通过一个简单示例,我们展示了现成的深度强化学习(RL)算法未必能免于这一认知错误。离策略学习方法被误导,而在策略学习方法则没有。实际含义是,将 RL 朴素地应用于复杂现实问题可能导致与人类所犯同类政策错误。应极其谨慎地理解支撑由强化学习导出之解的因果模型。

关键词

引用

@article{arxiv.2011.01010,
  title  = {Causal Campbell-Goodhart's law and Reinforcement Learning},
  author = {Hal Ashton},
  journal= {arXiv preprint arXiv:2011.01010},
  year   = {2021}
}