中文

基于因果容量的目标发现:高效强化学习中的探索

机器学习 2025-08-14 v1 人工智能

摘要

因果推断是人类探索世界的关键方式,这可以被建模为启用智能体在强化学习中高效探索环境。现有研究表明,建立动作与状态转变之间的因果关系有助于智能体推理政策如何影响其未来轨迹,从而促进有向探索。然而,由于在复杂场景的庞大状态-动作空间中,测量因果性具有挑战性。本文提出了一种名为目标发现与因果容量(GDCC)的新型框架,用于高效环境探索。具体而言,我们首先推导了状态空间中的因果容量度量,即表示智能体行为对未来轨迹最高影响力的度量。随后,我们提出了基于蒙特卡洛的方法识别离散状态空间中的关键点,并进一步优化该方法以适用于连续高维环境。这些关键点用于识别智能体在环境中作出重要决策的地方,从而将其视为我们的子目标,以引导智能体更有目的且更高效地探索。来自多目标任务的实证结果表明,因果容量高的状态与我们期望的子目标一致,GDCC 在基线方法上实现了显著的成功率提升。

关键词

引用

@article{arxiv.2508.09624,
  title  = {Goal Discovery with Causal Capacity for Efficient Reinforcement Learning},
  author = {Yan Yu and Yaodong Yang and Zhengbo Lu and Chengdong Ma and Wengang Zhou and Houqiang Li},
  journal= {arXiv preprint arXiv:2508.09624},
  year   = {2025}
}