中文

通过奖励塑形模仿学习为序贯决策任务合成生成类人数据

机器学习 2023-04-17 v1 人工智能

摘要

我们考虑在如计算机游戏这类交互式人-AI系统的背景下,合成生成能紧密模仿人类决策的数据的问题。我们提出一种新颖算法,能从极少量人类收集的决数据出发,生成合成的类人决策数据。我们提出的算法将奖励塑形的概念与模仿学习算法相整合以生成合成数据。我们已通过将合成生成的数据作为人类交互数据的替代,在类小型计算机游戏的设定中求解三个复杂度递增的序贯决策任务,从而验证了我们的合成数据生成技术。对我们结果的不同经验与统计分析表明,合成生成的数据可替代人类数据,并以与人类执行相同任务几乎不可区分、极低发散度的表现完成游戏任务。

关键词

引用

@article{arxiv.2304.07280,
  title  = {Synthetically Generating Human-like Data for Sequential Decision Making Tasks via Reward-Shaped Imitation Learning},
  author = {Bryan Brandt and Prithviraj Dasgupta},
  journal= {arXiv preprint arXiv:2304.07280},
  year   = {2023}
}

备注

SPIE Defense + Commercial Sensing 2023, Conference on Synthetic Data for Artificial Intelligence and Machine Learning: Tools, Techniques, and Applications, Orlando, FL, May 1-3, 2023