论奖励推断对人类模型误设的敏感性
机器学习
2023-10-31 v2 人工智能
摘要
从人类行为中推断奖励函数处于价值对齐——即让人工智能目标与我们人类真正想要的相一致——的核心。但这样做依赖于在人类给定其目标时如何行为的模型。经过认知科学、神经科学和行为经济学数十年的研究,获得准确的人类模型仍是一个开放的研究课题。这就引出了一个问题:这些模型需要多准确,奖励推断才能准确?一方面,如果模型中的小误差会导致推断中的灾难性错误,那么整个奖励学习框架似乎前景堪忧,因为我们永远不会有完美的人类行为模型。另一方面,如果随着我们的模型改进,我们能保证奖励准确性也随之提高,这将显示出在建模方面投入更多工作的益处。我们从理论和经验两方面研究这个问题。我们确实表明,不幸的是,有可能在行为中构造小的对抗性偏差,从而导致推断奖励中出现任意大的误差。然而,或许更重要的是,我们也能够识别出合理的假设,在这些假设下,奖励推断误差可由人类模型中的误差线性界定。最后,我们在具有模拟和人类数据的离散与连续控制任务中验证了我们的理论见解。
引用
@article{arxiv.2212.04717,
title = {On the Sensitivity of Reward Inference to Misspecified Human Models},
author = {Joey Hong and Kush Bhatia and Anca Dragan},
journal= {arXiv preprint arXiv:2212.04717},
year = {2023}
}
备注
published as a paper in ICLR 2023; 17 pages, 12 figures