故事塑造:用故事教智能体类人行为
人工智能
2023-01-25 v1 计算机科学与博弈论
人机交互
摘要
在强化学习智能体的奖励设计中,若不仅希望智能体在世界上达成某种效果,还在意该效果如何达成,则可能十分困难。例如,我们可能希望智能体遵守常识的默契理解、为安全目的使自身与行为偏好对齐,或在交互式游戏中扮演特定角色。讲故事是一种传达隐性程序性知识的方式。我们引入一种技术——故事塑造(Story Shaping),其中强化学习智能体从完成任务的一个范例故事中推断隐性知识,并因其所执行动作使当前环境契合所推断故事世界而内在地奖励自身。具体而言,故事塑造从观测中推断世界状态的知识图表示,并从范例故事中推断知识图。内在奖励基于智能体推断的世界状态图与推断的故事世界图之间的相似性生成。我们在需要常识推理并将智能体塑造为虚拟游戏角色的文本游戏中进行了实验。
引用
@article{arxiv.2301.10107,
title = {Story Shaping: Teaching Agents Human-like Behavior with Stories},
author = {Xiangyu Peng and Christopher Cui and Wei Zhou and Renee Jia and Mark Riedl},
journal= {arXiv preprint arXiv:2301.10107},
year = {2023}
}