基于信息瓶颈的分布式强化学习用于不确定感知DRAM等值化
机器学习
2026-05-07 v1
摘要
均衡器参数优化是高速内存系统在多吉比特数据速率下信号完整性的关键问题。然而,现有方法存在计算密集的瞳景图评估、针对期望而非最坏情况的优化,以及缺乏部署决策的不确定性量化等问题。本文提出一种集成信息瓶颈潜在表示与条件价值-at-Risk优化的分布式风险敏感强化学习框架。我们引入率失真最优信号压缩,实现了相对于瞳景图的51倍加速,同时通过蒙特卡罗 dropout 量化其认知不确定性。基于分位数回归的分布式强化学习实现了对最坏情况的显式优化,而PAC-Bayesian正则化则保证了泛化界限。在来自八个存储单元的240万个波形实验验证中,4-tap和8-tap均衡器配置实现了平均提升37.1%和41.5%,最坏情况保证分别为33.8%和38.2%,相较于Q-learning基线实现了80.7%和89.1%的改进。该框架实现了62.5%的高可靠性分类,消除了大多数配置的手动验证。这些结果表明,所提出的框架为生产规模的均衡器优化提供了具有认证最坏情况保证的实用解决方案。
引用
@article{arxiv.2603.04768,
title = {Distributional Reinforcement Learning with Information Bottleneck for Uncertainty-Aware DRAM Equalization},
author = {Muhammad Usama and Dong Eui Chang},
journal= {arXiv preprint arXiv:2603.04768},
year = {2026}
}