中文

面向零样本协作的知识驱动程序化强化学习

人工智能 2024-08-09 v1

摘要

零样本协作 (ZSC) 是合作 AI 领域的重大挑战,旨在学习代理以与未见的合作伙伴在训练环境甚至新环境中合作。近年来,结合深度强化学习 (DRL) 的自我对弈或基于群体的方法备受关注,以增强神经策略处理未见合作伙伴的能力。尽管取得了一些成功,这些方法通常依赖黑箱神经网络作为策略函数。然而,神经网络缺乏可解释性和逻辑,使所学策略难以被合作伙伴(如人类)理解,并限制了其泛化能力。这些短板阻碍了强化学习方法在多样化合作场景中的应用。我们建议以可解释程序表示代理的策略。不同于神经网络,程序包含稳定逻辑,但不可微分且难以优化。为自动学习此类程序,我们引入知识驱动的程序化强化学习用于零样本协作 (KnowPC)。我们首先定义基础域特定语言 (DSL),包括程序结构、条件原语和动作原语。一个显著挑战是庞大的程序搜索空间,使高效找到高性能程序困难。为此,KnowPC 集成提取器和推理器。提取器从多智能体交互轨迹中发现环境转移知识,而推理器则基于转移知识推导每个动作原语的前置条件。

关键词

引用

@article{arxiv.2408.04336,
  title  = {KnowPC: Knowledge-Driven Programmatic Reinforcement Learning for Zero-shot Coordination},
  author = {Yin Gu and Qi Liu and Zhi Li and Kai Zhang},
  journal= {arXiv preprint arXiv:2408.04336},
  year   = {2024}
}