中文

自主从成功与失败中学习:带负反馈的目标条件监督学习

机器学习 2025-09-04 v1 人工智能

摘要

强化学习在应用于具有稀疏奖励结构的任务时面临重大挑战。虽然模仿学习属于监督学习领域,能够实现更快的收敛,但它严重依赖人工生成的演示。最近,目标条件监督学习(GCSL)通过实现自模仿学习成为自主系统的一种潜在解决方案。通过策略性地重新标记目标,智能体可以从自身经验中获取策略洞察。尽管该框架取得了成功,但它存在两个显著的局限性:(1)仅从自生成经验中学习可能加剧智能体的固有偏差;(2)重新标记策略使智能体只能关注成功结果,使其无法从错误中学习。为了解决这些问题,我们提出了一种将对比学习原理融入 GCSL 框架的新模型,以从成功和失败中学习。通过实证评估,我们证明了我们的算法克服了智能体初始偏差带来的限制,从而实现了更具探索性的行为。这有助于发现和采用有效的策略,从而在多种具有挑战性的环境中实现更优的性能。

关键词

引用

@article{arxiv.2509.03206,
  title  = {Autonomous Learning From Success and Failure: Goal-Conditioned Supervised Learning with Negative Feedback},
  author = {Zeqiang Zhang and Fabian Wurzberger and Gerrit Schmid and Sebastian Gottwald and Daniel A. Braun},
  journal= {arXiv preprint arXiv:2509.03206},
  year   = {2025}
}