中文

面向目标条件强化学习的组合自动机嵌入

机器学习 2025-01-16 v2 人工智能 计算与语言 形式语言与自动机理论

摘要

目标条件强化学习是一种在运行时控制AI智能体行为的强大方法。然而,流行的目标表示,例如目标状态或自然语言,要么局限于马尔可夫任务,要么依赖于模糊的任务语义。我们提出使用时序确定性有限自动机(cDFA)的组合来表示时序目标,并使用cDFA来引导强化学习智能体。cDFA在形式化时序语义的需求与易于解释之间取得了平衡:如果能理解流程图,就能理解cDFA。另一方面,cDFA形成了一个具有布尔语义的可数无限概念类,并且自动机的细微变化可能导致截然不同的任务,这使得智能体难以根据其行为进行条件化。为了解决这个问题,我们观察到通过DFA的所有路径都对应一系列“到达-避免”任务,并提议在“到达-避免派生”的DFA上预训练图神经网络嵌入。通过实证评估,我们证明了所提出的预训练方法能够实现向各种cDFA任务类的零样本泛化,并加速策略特化,同时避免了分层方法的短视次优性。

关键词

引用

@article{arxiv.2411.00205,
  title  = {Compositional Automata Embeddings for Goal-Conditioned Reinforcement Learning},
  author = {Beyazit Yalcinkaya and Niklas Lauffer and Marcell Vazquez-Chanlatte and Sanjit A. Seshia},
  journal= {arXiv preprint arXiv:2411.00205},
  year   = {2025}
}