风险规避的批量主动逆奖励设计
机器学习
2023-11-21 v1
摘要
设计一个能刻画预期行为所有方面、并能在训练环境之外泛化的完美奖励函数几乎是不可能的。主动逆奖励设计(AIRD)提出使用一系列查询,在单一训练环境中比较可能的奖励函数。这使人能够向智能体提供关于次优行为的信息,从而计算出关于预期奖励函数的概率分布。然而,它忽略了真实世界环境中出现未知特征的可能性,以及在智能体完全学习到奖励函数之前所需的安全措施。我改进了该方法并创建了风险规避的批量主动逆奖励设计(RBAIRD),其构建批次(即智能体在真实世界中使用时所遇到的环境集合),按顺序处理它们,并在预定次数的迭代中,对批次中每个环境询问需要人类回答的查询。在一个批次中该过程完成后,概率得到改进并传递至下一批次。这使其能适应真实世界场景,并学习如何处理首次遇到的未知特征。我还集成了一个类似于逆奖励设计(IRD)的风险规避规划器,其从概率分布中采样一组奖励函数,并计算采取尽可能确定奖励的轨迹。这确保了智能体仍在学习奖励函数时的安全性,并使该方法可用于谨慎性至关重要的情形。RBAIRD 在效率、准确性和动作确定性方面优于先前方法,展示了对新的未知特征的快速适应性,并可更广泛地用于关键、强大 AI 模型的对齐。
引用
@article{arxiv.2311.12004,
title = {Risk-averse Batch Active Inverse Reward Design},
author = {Panagiotis Liampas},
journal= {arXiv preprint arXiv:2311.12004},
year = {2023}
}
备注
14 pages, 12 figures