中文

AlphaSeq:基于深度强化学习的序列发现方法

机器学习 2019-08-09 v3

摘要

序列在许多应用与系统中扮演重要角色。发现具有所需性质的序列长期以来都是一项引人入胜的智力追求。本文提出一种新范式AlphaSeq,利用深度强化学习(DRL)技术以算法方式发现所需序列。AlphaSeq将序列发现问题视为一个情节式符号填充博弈,其中玩家在博弈的一局中依次将符号填入一个序列集的空位。每局以完全填满的序列集结束,并依据该序列集的可取性给予奖励。AlphaSeq将该博弈建模为马尔可夫决策过程(MDP),并适配AlphaGo的DRL框架来求解此MDP。随着AlphaSeq从新手通过学习多局博弈成为专家玩家,所发现的序列逐步改善。与传统的数学工具序列构造相比,AlphaSeq特别适用于目标复杂、难以进行数学分析的问题。我们在两个应用中展示了AlphaSeq的搜索能力:1) AlphaSeq成功重新发现了一组理想互补码,可在多载波CDMA系统中零迫零所有潜在干扰。2) AlphaSeq发现了新序列,在脉冲压缩雷达系统的失配滤波器估计器中,相较于著名的Legendre序列,将信干比提升了三倍。

关键词

引用

@article{arxiv.1810.01218,
  title  = {AlphaSeq: Sequence Discovery with Deep Reinforcement Learning},
  author = {Yulin Shao and Soung Chang Liew and Taotao Wang},
  journal= {arXiv preprint arXiv:1810.01218},
  year   = {2019}
}

备注

48 pages, 13 figures