LANTERN:LLM 增强的神经符号迁移,经验门控推理网络
人工智能
2026-05-08 v1
摘要
强化学习(RL)中的迁移学习旨在通过利用来自相关来源的知识来加速在新任务中的学习。然而,现有的神经符号迁移方法通常依赖手动指定的任务自动机,假设单个来源任务,并使用固定的知识集成机制,无法适应不同来源的相关性。我们提出 LANTERN,一个用于多源神经符号迁移的统一框架,通过三个组件来解决这些限制:(i)使用大语言模型从自然语言任务描述生成的确定性有限自动机,(ii)基于语义嵌入的多个源策略聚合,按跨任务相似度加权,(iii)基于时序差分误差和语义不确定性的自适应教师-学生门控。跨越资源管理、导航和控制等领域,LANTERN 在样本效率上比现有基线提高了 40%-60%,同时对 poorly 对齐的来源仍然稳健。这些结果表明,多源、自适应加权的神经符号迁移可以提高符号 RL 设置中的可扩展性和鲁棒性。
引用
@article{arxiv.2605.05478,
title = {LANTERN: LLM-Augmented Neurosymbolic Transfer with Experience-Gated Reasoning Networks},
author = {Mahyar Alinejad and Yue Wang and Amrit Singh Bedi and George Atia},
journal= {arXiv preprint arXiv:2605.05478},
year = {2026}
}