目标作为奖励产生程序
人工智能
2025-05-20 v3
摘要
人们非常擅长生成自己的目标,从儿童游戏开始一直持续到成年。尽管在目标和目标导向行为方面有大量的实证和计算工作,但模型仍然远未捕捉到日常人类目标的丰富性。在这里,我们通过收集人类生成的游戏性目标数据集(以可评分的单人游戏形式),将它们建模为奖励产生程序,并通过程序合成生成新颖的类人目标来弥合这一差距。奖励产生程序通过符号操作(组合、添加时间约束)捕捉目标的丰富语义,并允许在行为轨迹上执行程序以评估进展。为了构建目标的生成模型,我们在无限可能的目标程序集合上学习一个适应度函数,并使用质量-多样性算法采样新颖的目标。人类评估者发现,当从人类示例占据的程序空间分区中采样时,模型生成的目标与人类创建的游戏无法区分。我们还发现,我们模型的内部适应度分数能够预测那些被评估为更有趣、更类人的游戏。
引用
@article{arxiv.2405.13242,
title = {Goals as Reward-Producing Programs},
author = {Guy Davidson and Graham Todd and Julian Togelius and Todd M. Gureckis and Brenden M. Lake},
journal= {arXiv preprint arXiv:2405.13242},
year = {2025}
}
备注
Project website and goal program viewer: https://exps.gureckislab.org/guydav/goal_programs_viewer/main/