中文

自动机蒸馏:面向深度强化学习的神经-符号迁移学习

机器学习 2024-11-11 v2 人工智能

摘要

强化学习 (RL) 是序贯决策过程中寻找最优策略的有力工具。然而,深度 RL 方法有两个弱点:收集实际 RL 问题所需的智能体经验量极其昂贵,且学到的策略在训练数据分布之外的任务上泛化性差。为缓解这些问题,我们引入自动机蒸馏,一种神经-符号迁移学习形式,其中将教师模型的 Q 值估计蒸馏为以自动机形式的低维表示。我们随后提出从教师的深度 Q 网络 (DQN) 中提取符号信息以生成 Q 值估计的方法。所得 Q 值估计分别通过改进的 DQN 与双延迟深度确定性 (TD3) 损失函数,用于在目标离散与连续环境中引导学习。我们证明自动机蒸馏减少了在新环境中为各类决策任务找到最优策略所需时间,即使在结构与源环境不同的目标环境中亦如此。

关键词

引用

@article{arxiv.2310.19137,
  title  = {Automaton Distillation: Neuro-Symbolic Transfer Learning for Deep Reinforcement Learning},
  author = {Suraj Singireddy and Precious Nwaorgu and Andre Beckus and Aden McKinney and Chinwendu Enyioha and Sumit Kumar Jha and George K. Atia and Alvaro Velasquez},
  journal= {arXiv preprint arXiv:2310.19137},
  year   = {2024}
}