因果性坎贝尔-古德哈特定律与强化学习
机器学习
2021-02-19 v2 人工智能
综合经济学
经济学
摘要
坎贝尔-古德哈特定律涉及一类因果推断错误,即决策主体旨在影响与其目标相关但不可靠地导致其目标的变量。这是经济学与政治科学中众所周知的错误,但在人工智能研究中并未被广泛标识。通过一个简单示例,我们展示了现成的深度强化学习(RL)算法未必能免于这一认知错误。离策略学习方法被误导,而在策略学习方法则没有。实际含义是,将 RL 朴素地应用于复杂现实问题可能导致与人类所犯同类政策错误。应极其谨慎地理解支撑由强化学习导出之解的因果模型。
引用
@article{arxiv.2011.01010,
title = {Causal Campbell-Goodhart's law and Reinforcement Learning},
author = {Hal Ashton},
journal= {arXiv preprint arXiv:2011.01010},
year = {2021}
}