中文

基于扩散的离线强化学习用于增强ARC任务中的决策

人工智能 2024-10-16 v1 计算机视觉与模式识别 机器学习

摘要

有效的长期策略使AI系统能够通过在扩展的时间范围内做出顺序决策来导航复杂环境。类似地,强化学习(RL)代理优化跨序列的决策以最大化奖励,即使没有立即的反馈。为验证已知的扩散基于离线强化学习方法——潜在扩散受限Q学习(LDCQ)在多步骤决策中展现出强大的推理能力,我们旨在评估其在抽象推理语料库(ARC)上的性能。然而,由于ARC训练集缺乏足够的经验数据, 将离线强化学习方法应用于ARC以增强AI的战略推理能力具有挑战性。为解决这一限制,我们引入了一个用于ARC的增强离线强化学习数据集,称为Synthesized Offline Learning Data for Abstraction and Reasoning(SOLAR),以及SOLAR-Generator,其根据预定义规则生成多样化的轨迹数据。SOLAR通过提供足够的经验数据,使离线强化学习方法得以应用。我们为一个简单任务合成了SOLAR,并用LDCQ方法训练了一个智能体。我们的实验表明,离线强化学习方法在简单ARC任务上有效,显示了智能体做出多步骤顺序决策并正确识别答案状态的能力。这一结果凸显了离线强化学习方法增强AI战略推理能力的潜力。

关键词

引用

@article{arxiv.2410.11324,
  title  = {Diffusion-Based Offline RL for Improved Decision-Making in Augmented ARC Task},
  author = {Yunho Kim and Jaehyun Park and Heejun Kim and Sejin Kim and Byung-Jun Lee and Sundong Kim},
  journal= {arXiv preprint arXiv:2410.11324},
  year   = {2024}
}

备注

Preprint, Under review. Comments welcome