中文

通过奖励设计实现可接受策略教导

机器学习 2022-01-07 v1 人工智能

摘要

我们研究奖励设计策略,用于激励强化学习智能体从一组可接受策略中采纳某策略。奖励设计者的目标是以高成本效益方式修改底层奖励函数,同时确保在新奖励函数下任何近似最优的确定性策略都是可接受的,且在原奖励函数下表现良好。该问题可视为最优奖励投毒攻击问题的对偶:奖励设计者不是迫使智能体采纳特定策略,而是激励智能体避免在某些状态下采取不可接受的动作。或许令人惊讶的是,与最优奖励投毒攻击问题相反,我们首先证明可接受策略教导的奖励设计问题在计算上具有挑战性,且寻找近似最优奖励修改为 NP-hard。随后我们构建一个代理问题,其最优解逼近本设定下奖励设计问题的最优解,但更适于优化技术与分析。针对该代理问题,我们给出刻画结果,提供了最优解值的界。最后,我们设计局部搜索算法求解代理问题,并通过基于仿真的实验展示其实用性。

关键词

引用

@article{arxiv.2201.02185,
  title  = {Admissible Policy Teaching through Reward Design},
  author = {Kiarash Banihashem and Adish Singla and Jiarui Gan and Goran Radanovic},
  journal= {arXiv preprint arXiv:2201.02185},
  year   = {2022}
}