面向马尔可夫信源零延迟码近最优设计的强化学习
信息论
2024-06-18 v4 math.IT
最优化与控制
摘要
在经典的有损信源编码问题中,人们对长块信源符号进行编码,使失真逼近最终的香农极限。这种块编码方法引入了较大延迟,在许多对延迟敏感的应用中并不可取。我们考虑零延迟情形,其目标是在无任何延迟的情况下对有限字母表马尔可夫信源进行编码与解码。已有研究表明,该问题适用于随机控制技术,并由此得到存在性、结构性及一般结构逼近结果。然而,这些技术迄今仅产生了计算上难以实现的码设计算法实现。为解决此问题,我们提出一种强化学习设计算法,并严格证明其渐近最优性。具体而言,我们表明可利用量化Q学习算法获得该问题的近最优编码策略。证明基于近期关于弱Feller受控马尔可夫链的量化Q学习结果,其应用需要发展关于正则性与稳定性性质的支持性技术结果,并将折扣与平均代价无限 horizon 准则问题的最优解相关联。这些理论结果得到了仿真的支持。
引用
@article{arxiv.2311.12609,
title = {Reinforcement Learning for Near-Optimal Design of Zero-Delay Codes for Markov Sources},
author = {Liam Cregg and Tamas Linder and Serdar Yuksel},
journal= {arXiv preprint arXiv:2311.12609},
year = {2024}
}
备注
15 pages, 3 figures; accepted for publication in IEEE Transactions on Information Theory