多主体强化学习的有针对性干预原则
高能天体物理现象
2026-02-25 v2
摘要
引导合作性多主体强化学习 (MARL) 达到理想结果面临挑战,尤其是在大规模 MARL 场景下,对整个系统的全局指导来自人类的干预往往不切实际。另一方面,设计外部机制(如内在奖励和人类反馈)来协调主体,主要依赖经验性研究,缺乏易于使用的研究工具。本文采用多主体影响图 (MAID) 作为图形框架来解决上述问题。首先,我们引入 MARL 交互范式的概念(与 MARL 学习范式正交),使用 MAID 来分析和可视化 MARL 中的无指导自组织与全局指导机制。随后,我们设计了一种新的 MARL 交互范式,称为针对性干预范式,该范式仅应用于单个被目标主体,以缓解全局指导的问题。在实现方面,我们引入一种因果推断技术,称为预策略干预 (Pre-Strategy Intervention, PSI),以实现针对性干预范式。由于 MAID 可视为一类因果图,通过最大化相应因果效应,PSI 可实现将主要任务目标与额外期望结果整合在内的复合期望结果。此外,MAID 的捆绑相关图分析提供了识别 MARL 学习范式是否在 MARL 交互范式设计下可行的工具。在实验中,我们展示了所提出的针对性干预的有效性,并验证了相关图分析的结果。
引用
@article{arxiv.2510.17696,
title = {Clumpy Outflows from Super-Eddington Accreting Black Holes I: Radiation Hydrodynamics Simulations and Observational Implications},
author = {Haojie Hu and Yuta Asahina and Shogo Yoshioka and Hiroyuki R. Takahashi and Ken Ohsuga},
journal= {arXiv preprint arXiv:2510.17696},
year = {2026}
}
备注
10 pages, 9 figures, accepted for publication in PASJ