中文

从被动复用到主动推理:面向神经符号经验回放的大语言模型接地

人工智能 2026-05-12 v1

摘要

虽然经验回放对强化学习(RL)中的数据效率至关重要,但标准方法将回放缓冲区视为被动的记忆系统,基于数值预测误差而非语义重要性来对样本进行优先级排序。这种方法与人类学习形成对比,后者通过主动将碎片化经验抽象为行为规则来加速掌握。为弥合这一差距,我们提出了神经符号经验回放(NSER),一种将经验回放从被动样本复用机制转变为知识构建主动引擎的框架。具体而言,NSER 通过一种新颖的神经符号接地流水线解决了语言推理与数值优化之间的不兼容性。它以零样本方式利用大语言模型(LLM)从累积的轨迹中归纳候选行为规则,将这些见解接地为可微的一阶逻辑表示,并利用所得的符号结构动态重新加权回放分布。通过允许抽象知识直接塑造策略优化,NSER 在反应式、基于规则和程序化基准上均实现了持续优越的样本效率和收敛速度。

关键词

引用

@article{arxiv.2605.09419,
  title  = {From Passive Reuse to Active Reasoning: Grounding Large Language Models for Neuro-Symbolic Experience Replay},
  author = {Yanan Xiao and Yixiang Tang and Zechen Feng and Lu Jiang and Minghao Yin and Pengyang Wang},
  journal= {arXiv preprint arXiv:2605.09419},
  year   = {2026}
}