OS-R1:基于强化学习的智能操作系统内核调优
机器学习
2025-08-19 v1 人工智能
操作系统
软件工程
摘要
操作系统(OS)性能优化依赖于内核调优,但现有方法常面临效率、可扩展性和泛化性挑战。本文引入OS-R1,一个由基于规则的强化学习(RL)驱动的智能Linux内核调优框架。通过将内核配置空间抽象为RL环境,OS-R1利用大语言模型(LLM)实现高效探索,确保配置修改的准确性。此外,设计了自定义奖励函数以提升推理标准化、配置修改精度和LLM对系统性能的感知能力。进一步提出的两阶段训练过程加快收敛速度,减少跨不同调优场景的再训练。实验结果表明,OS-R1显著优于现有基线方法,实现最高5.6%的性能提升,显著优于启发式调优,同时保持高数据效率。值得注意的是,OS-R1适用于各种实际应用,展示了在多样化环境中部署的潜力。我们的数据集和代码已公开于https://github.com/LHY-24/OS-R1。
引用
@article{arxiv.2508.12551,
title = {OS-R1: Agentic Operating System Kernel Tuning with Reinforcement Learning},
author = {Hongyu Lin and Yuchen Li and Haoran Luo and Kaichun Yao and Libo Zhang and Mingjie Xing and Yanjun Wu},
journal= {arXiv preprint arXiv:2508.12551},
year = {2025}
}