用于嵌套极化码构造的强化学习
信息论
2019-11-12 v2 机器学习
math.IT
摘要
在本文中,我们将嵌套极化码构造建模为马尔可夫决策过程(MDP),并利用先进的强化学习(RL)技术来解决它。首先,在极化码背景下定义具有状态、动作和奖励的MDP环境。具体而言,一个状态表示极化码的构造,一个动作指定其缩减为子码,奖励为译码性能。提出了一种由策略网络和价值网络组成的神经网络架构,基于观测状态生成动作,旨在最大化总体奖励。定义了损失函数以权衡利用与探索。为了进一步提高学习效率和质量,提出了一种“集成学习”范式。它首先使用遗传算法为每个生成一组(子)最优极化码,然后将它们作为先验知识来精炼RL中的策略。该范式被证明能加速训练过程,并收敛到更好的性能。仿真结果表明,在连续抵消列表(SCL)译码器下,所提出的基于学习的极化码构造取得了与最先进水平相当甚至更好的性能。最后但同样重要的是,这在学习算法中未利用来自极化码理论的任何专家知识。
引用
@article{arxiv.1904.07511,
title = {Reinforcement Learning for Nested Polar Code Construction},
author = {Lingchen Huang and Huazi Zhang and Rong Li and Yiqun Ge and Jun Wang},
journal= {arXiv preprint arXiv:1904.07511},
year = {2019}
}
备注
8 pages, 10 figures, propose a multi-stage genetic algorithm