SyGra:面向合成数据生成、质量标签与管理的统一图基框架
人工智能
2025-12-12 v3 计算与语言
机器学习
摘要
大型语言模型(LLMs)的发展严重依赖高质量数据集用于监督微调(SFT)、对齐任务如直接偏好优化(DPO)等。在本工作中,我们提出了一个综合性的合成数据生成框架,支持面向这些训练范式的可扩展、可配置且高保真度的数据生成。该方法采用模块化、配置驱动的管道,能够以最少的人工干预建模复杂的对话流程。该框架采用双阶段质量标签机制,结合启发式规则和 LLM 评估,自动筛选并评分来自 OASST 格式对话的数据,确保精选出高质量的对话样本。生成的数据集结构化地支持 SFT 和 DPO 用例,实现 seamless 集成到多样化的训练工作流程中。正是这些创新为规模化地生成和管理合成对话数据提供了稳健的解决方案,显著降低了 LLM 训练管道中数据准备的开销。
引用
@article{arxiv.2508.15432,
title = {SyGra: A Unified Graph-Based Framework for Scalable Generation, Quality Tagging, and Management of Synthetic Data},
author = {Bidyapati Pradhan and Surajit Dasgupta and Amit Kumar Saha and Omkar Anustoop and Sriram Puttagunta and Vipul Mittal and Gopal Sarda},
journal= {arXiv preprint arXiv:2508.15432},
year = {2025}
}