Trinity-RFT:用于大型语言模型强化微调的通用统一框架
机器学习
2025-09-30 v3 计算与语言
分布式、并行与集群计算
摘要
Trinity-RFT 是一个通用、统一且易于使用的框架,旨在进行大型语言模型的强化微调(RLFT)。它采用模块化和解耦设计,包含 (1) 统一和泛化同步/异步、在策略/离策略以及在线/离线模式的RLFT核心;(2) 与环境交互的无缝集成,具有高效性和鲁棒性;(3) 为RLFT优化的系统数据管线。Trinity-RFT 可以轻松适应多样化的应用场景,作为在宏观和微观水平上开发和研究先进强化学习范式的统一平台。本技术报告概述了Trinity-RFT的愿景、功能、设计与实现,并附有大量示例、应用和实验,展示其功能性和用户友好性。
引用
@article{arxiv.2505.17826,
title = {Trinity-RFT: A General-Purpose and Unified Framework for Reinforcement Fine-Tuning of Large Language Models},
author = {Xuchen Pan and Yanxi Chen and Yushuo Chen and Yuchang Sun and Daoyuan Chen and Wenhao Zhang and Yuexiang Xie and Yilun Huang and Yilei Zhang and Dawei Gao and Weijie Shi and Yaliang Li and Bolin Ding and Jingren Zhou},
journal= {arXiv preprint arXiv:2505.17826},
year = {2025}
}
备注
This technical report will be continuously updated as the codebase evolves. GitHub: https://github.com/modelscope/Trinity-RFT