CIRL 框架中的不可纠正性
人工智能
2018-06-05 v2
摘要
假设关机指令提供了关于哪些动作能带来有价值结果的信息(技术意义上),价值学习系统就有动机遵循关机指令。然而,这一假设对模型误设(例如程序员出错的情况)并不稳健。我们通过提出一些有监督 POMDP 场景来证明这一点,在这些场景中,参数化奖励函数中的错误消除了遵循关机指令的动机。这些困难与 Soares 等人 (2015) 在其关于可纠正性的论文中所讨论的类似。我们认为,重要的是考虑在更弱的假设集下遵循关机指令的系统(例如,假设一个经过验证的小型模块被正确实现;而不是整个先验概率分布和/或参数化奖励函数)。我们讨论了在价值学习框架中尝试获得此类保证的简单方法所面临的一些困难。
引用
@article{arxiv.1709.06275,
title = {Incorrigibility in the CIRL Framework},
author = {Ryan Carey},
journal= {arXiv preprint arXiv:1709.06275},
year = {2018}
}