用反事实轨迹解释学习到的奖励函数
人工智能
2024-10-16 v4 机器学习
摘要
从人类行为或反馈中学习奖励是将 AI 系统与人类价值观对齐的一种有前景的方法,但未能始终如一地提取正确的奖励函数。可解释性工具可以使用户理解和评估学习到的奖励函数中可能存在的缺陷。我们提出了反事实轨迹解释(CTEs),通过对比原始部分轨迹与反事实部分轨迹及其各自获得的奖励,来解释强化学习中的奖励函数。我们推导了 CTEs 的六个质量标准,并提出了一种基于蒙特卡洛的新颖算法来生成优化这些质量标准的 CTEs。最后,我们通过训练代理人类模型来衡量生成的解释对该模型的 informativeness。CTEs 被证明对代理人类模型具有信息量,增加了其预测与未见轨迹上奖励函数之间的相似性。此外,它学会了准确判断轨迹之间的奖励差异,并泛化到分布外示例。虽然 CTEs 并不能导致对奖励的完美理解,但我们的方法,更广泛地说,XAI 方法的适配,被展示为解释学习到的奖励函数的一种富有成效的途径。
引用
@article{arxiv.2402.04856,
title = {Explaining Learned Reward Functions with Counterfactual Trajectories},
author = {Jan Wehner and Frans Oliehoek and Luciano Cavalcante Siebert},
journal= {arXiv preprint arXiv:2402.04856},
year = {2024}
}