中文

BitRL: 面向资源受限边缘部署的 1 位量化强化学习语言模型

机器学习 2026-04-28 v1

摘要

在资源受限的边缘设备上部署智能强化学习 (RL) 代理仍是一个根本性挑战,原因在于现代深度学习系统在内存、计算和能源方面的巨大需求。虽然大型语言模型 (LLM) 已作为决策-making 代理的强大架构涌现,但其数十亿参数规模将其限制在云端部署,引发关于延迟、隐私和连接依赖性的担忧。我们引入 BitRL,一个利用 1 位量化语言模型构建 RL 代理的框架,使其在严苛资源受限条件下实现实际的设备学习和推理。借助 BitNet b1.58 架构(采用三值权重 (-1, 0, +1) 及优化推理堆栈),BitRL 在保持 85-98% 基准任务性能的同时,实现了 10-16 倍的内存降低和 3-5 倍的能效提升。我们对量化作为结构化参数扰动进行了理论分析,推导了在冻结背bone 架构下对量化策略梯度的收敛界限,确定了极端量化下的探索-稳定性权衡。我们的框架系统性地将 1 位量化语言模型与强化学习集成,用于边缘部署,并在通用硬件上Demonstrate有效性。

关键词

引用

@article{arxiv.2604.24273,
  title  = {BitRL: Reinforcement Learning with 1-bit Quantized Language Models for Resource-Constrained Edge Deployment},
  author = {Md. Ashiq Ul Islam Sajid and Mohammad Sakib Mahmood and Md. Tareq Hasan and Md Abdur Rahim and Rafat Ara and Md. Arafat Hossain},
  journal= {arXiv preprint arXiv:2604.24273},
  year   = {2026}
}

备注

6pages, 1 Figure, IEEE International Conference of Frontiers of Engineering and Emerging Technologies 2026