利用 Sinkhorn 策略梯度学习置换
机器学习
2018-05-21 v1 机器学习
摘要
组合数学与计算机科学交叉领域的许多问题需要求解一个能最优匹配、排序或排序某些数据的置换。这些问题通常具有任务特定的、往往不可微的目标函数,数据驱动算法可将其用作学习信号。本文中,我们提出 Sinkhorn 策略梯度 (SPG) 算法,用于在置换矩阵上学习策略。我们为 SPG 引入的 actor-critic 神经网络架构,通过温度控制的 Sinkhorn 层,将状态空间的表示学习与具有高度结构化动作空间的置换独特地解耦。Sinkhorn 层产生置换矩阵的连续松弛,从而可以对 actor-critic 架构进行端到端训练。我们的实证结果表明,用 SPG 训练的智能体在排序、欧几里得 TSP 和匹配任务上可取得有竞争力的表现。我们还观察到,在匹配任务上 SPG 比基线方法显著更具数据效率,这表明 SPG 有助于学习与置换推理有用的表示。
引用
@article{arxiv.1805.07010,
title = {Learning Permutations with Sinkhorn Policy Gradient},
author = {Patrick Emami and Sanjay Ranka},
journal= {arXiv preprint arXiv:1805.07010},
year = {2018}
}
备注
16 pages, under review for NIPS 2018 conference