中文

面向资源受限边缘设备的小型化、基于设备的决策者:MiniConv库

机器学习 2025-12-24 v1

摘要

强化学习(RL)取得了显著成果,但在资源受限的边缘设备上部署视觉策略仍具有挑战性,主要due to计算成本和通信延迟。许多部署因此将策略推理卸载到远程服务器,导致网络往返延迟并需要传输高维观察。我们提出一种分段策略架构,其中小型设备端编码器实现为OpenGL片段着色器通过,以获得广泛的嵌入式GPU支持,将每个观察转换为紧凑的特征张量并传输到远程策略头部。在RL中,这种通信开销表现为闭环决策延迟而非仅限于每请求的推理延迟。该方法减少了传输数据、降低了带宽受限环境下的决策延迟和服务器端每请求的计算量,同时通过最终回报(在单个运行基准中完成100个最终episodes的平均值)实现相当的学习性能,虽在平均回报方面有适度的权衡。我们在NVIDIA Jetson Nano、树莓派4B和树莓派Zero 2 W上进行评估,报告学习结果、在持续负载下的设备端执行行为以及在带宽限制下的端到端决策延迟和可扩展性测量。代码以开源形式发布,包括训练、部署和测量。

关键词

引用

@article{arxiv.2512.19725,
  title  = {Out-of-Distribution Detection for Continual Learning: Design Principles and Benchmarking},
  author = {Srishti Gupta and Riccardo Balia and Daniele Angioni and Fabio Brau and Maura Pintor and Ambra Demontis and Alessandro Sebastian and Salvatore Mario Carta and Fabio Roli and Battista Biggio},
  journal= {arXiv preprint arXiv:2512.19725},
  year   = {2025}
}

备注

International Journal of Computer Vision