中文

基于模型的规划代理行为保证的奖励界

人工智能 2024-02-22 v1

摘要

近年来,人们对野外基于机器学习的代理(尤其是在机器人领域)的可信度产生了新兴兴趣,旨在为行业提供安全保障。获得这些代理的行为保证仍然是一个重要问题。在这项工作中,我们专注于保证基于模型的规划代理在特定的未来时间步内达到目标状态。我们表明,在目标状态处存在一个奖励下界,如果所述奖励低于该界,则不可能获得此类保证。以此类推,我们展示了如何在多个目标上强制实施偏好。

关键词

引用

@article{arxiv.2402.13419,
  title  = {Reward Bound for Behavioral Guarantee of Model-based Planning Agents},
  author = {Zhiyu An and Xianzhong Ding and Wan Du},
  journal= {arXiv preprint arXiv:2402.13419},
  year   = {2024}
}

备注

To be published in ICLR 24 tiny paper track