发现可控制的东西:强化学习中的干预边界发现
机器学习
2026-05-08 v2 人工智能
摘要
当 RL 代理的观察包含由与真实状态相同 confounder 驱动的干扰物时,仅凭观察数据无法识别代理控制的哪些维度。在我们的基准测试中,即使是以状态为条件的观察选择器也可能在干扰物模拟可控状态变量时崩溃。我们提出了干预边界发现(IBD),将代理自身的 action channel 作为随机干预的来源:随机化动作实现干预对比,按维度进行两样本检验并采用 FDR 校正,生成观察维度上的二进制掩码。 在 12 个连续控制设置中(最多包含 100 个干扰物)进行测试,IBD 在 11 个设置中匹配 oracle return,而包括互信息、状态条件前向模型和基于梯度的灵敏度分析等观察基线方法常常表现不佳,仅仅将完整观察传递给 SAC。
引用
@article{arxiv.2603.18257,
title = {Discovering What You Can Control: Interventional Boundary Discovery for Reinforcement Learning},
author = {Jiaxin Liu and Anzhe Cheng and Paul Bogdan},
journal= {arXiv preprint arXiv:2603.18257},
year = {2026}
}