中文

对抗式反事实环境模型学习

机器学习 2023-10-10 v2

摘要

一个用于动作-效果预测的优良模型(称为环境模型)对于在机器人控制、推荐系统和患者治疗选择等诸多领域实现样本高效的决策策略学习十分重要。我们可以利用这样的模型进行无限次试验以识别合适的动作,从而节省真实世界中的查询代价。这要求模型能正确处理未见过的数据,亦称反事实数据。然而,标准的数据拟合技术并不能自动获得此种泛化能力,通常导致不可靠的模型。本工作中,我们在模型学习中引入反事实查询风险最小化(CQRM),以泛化到由特定目标策略查询得到的反事实数据集。由于目标策略在策略学习中可能多样且未知,我们提出一种对抗式 CQRM 目标,其中模型在由对抗策略查询的反事实数据上学习,并最终导出一种可处理的求解方法 GALILEO。我们还发现对抗式 CQRM 与对抗式模型学习密切相关,解释了后者的有效性。我们将 GALILEO 应用于合成任务和一个真实世界应用。结果表明 GALILEO 在反事实数据上做出准确预测,从而显著改进了真实世界测试中的策略。

关键词

引用

@article{arxiv.2206.04890,
  title  = {Adversarial Counterfactual Environment Model Learning},
  author = {Xiong-Hui Chen and Yang Yu and Zheng-Mao Zhu and Zhihua Yu and Zhenjun Chen and Chenghe Wang and Yinan Wu and Hongqiu Wu and Rong-Jun Qin and Ruijin Ding and Fangsheng Huang},
  journal= {arXiv preprint arXiv:2206.04890},
  year   = {2023}
}