中文

在线二分匹配的深层策略:一种强化学习方法

机器学习 2022-11-01 v3 人工智能

摘要

广泛适用的在线匹配问题的挑战在于,在未来输入存在不确定性的情况下做出不可撤销的分配。大多数有理论依据的策略本质上是短视或贪婪的。在匹配过程定期重复的真实世界应用中,可利用底层数据分布以做出更好的决策。我们提出一个端到端强化学习框架,基于历史数据的试错来推导更好的匹配策略。我们设计了一组神经网络架构,构建了特征表示,并在两个在线匹配问题上对其进行了实证评估:边加权在线二分匹配与在线次模二分匹配。我们表明,大多数学习方法在四个合成与真实世界数据集上稳定优于经典基线算法。平均而言,我们提出的模型在各种合成与真实世界数据集上将匹配质量提升了 3–10%。我们的代码公开于 https://github.com/lyeskhalil/CORL。

关键词

引用

@article{arxiv.2109.10380,
  title  = {Deep Policies for Online Bipartite Matching: A Reinforcement Learning Approach},
  author = {Mohammad Ali Alomrani and Reza Moravej and Elias B. Khalil},
  journal= {arXiv preprint arXiv:2109.10380},
  year   = {2022}
}

备注

https://openreview.net/forum?id=mbwm7NdkpO