可证明正确的自动机嵌入用于最优自动机条件强化学习
机器学习
2025-05-26 v2 人工智能
计算与语言
形式语言与自动机理论
摘要
自动机条件强化学习(RL)在学习能够在运行时执行时间扩展目标的多任务策略方面取得了有前景的结果,方法是在训练下游策略之前预训练并冻结自动机嵌入。然而,此前未给出理论保证。本工作为自动机条件RL问题提供了理论框架,并证明其是可近似正确学习的。随后我们提出了一种学习可证明正确的自动机嵌入的技术,保证了最优多任务策略学习。我们的实验评估证实了这些理论结果。
引用
@article{arxiv.2503.05042,
title = {Provably Correct Automata Embeddings for Optimal Automata-Conditioned Reinforcement Learning},
author = {Beyazit Yalcinkaya and Niklas Lauffer and Marcell Vazquez-Chanlatte and Sanjit A. Seshia},
journal= {arXiv preprint arXiv:2503.05042},
year = {2025}
}