因果bandits中的图学习次优
机器学习
2026-05-08 v3
摘要
我们研究了在因果带环问题中进行regret最小化的情形,假设代理人不知道底层因果结构。以前的工作集中于识别奖励的父节点,然后应用经典bandit方法,或在最小化regret的同时联合学习父节点。我们检验了此类策略是否最优。颇具反常性的是,我们的结果表明,学习父节点集次优。我们通过证明存在情形,其中regret最小化与父节点识别在根本上存在冲突,从而进一步分析已知和未知父节点集大小的情形,建立新的regret下界以捕捉动作空间的组合结构。基于这些见解,我们提出近乎最优的算法,绕过图和父节点恢复,表明父节点识别对regret最小化确实不必要。实验确认,在各种环境中,我们的方法与现有基线之间存在显著的性能差距。
引用
@article{arxiv.2510.16811,
title = {Graph Learning Is Suboptimal in Causal Bandits},
author = {Mohammad Shahverdikondori and Jalal Etesami and Negar Kiyavash},
journal= {arXiv preprint arXiv:2510.16811},
year = {2026}
}
备注
32 pages, accepted at AISTATS 2026