中文

自动为大型语言模型生成大量跨不同粒度的上下文驱动SFT数据

计算与语言 2024-05-28 v1

摘要

从自定义语料库构建高质量的查询-响应对对于在许多应用中(如创建特定领域的AI助手或角色扮演代理)对大型语言模型(LLM)进行监督微调(SFT)至关重要。然而,通过人工标注获取这些数据成本高昂,而现有的自动化方法通常无法捕获上下文粒度的多样化范围,并且倾向于生成同质数据。为了解决这些问题,我们引入了一种名为AugCon的新方法,该方法能够自动生成跨多个粒度级别的上下文驱动的SFT数据,具有高多样性、高质量和高保真度。AugCon首先使用上下文分割树(CST)生成查询,这是一种递归推导查询和分割上下文以覆盖完整粒度的创新方法。然后,我们通过对比学习训练一个评分器,与CST协作对查询进行排序和优化。最后,引入自我对齐和自我改进的协同集成,以获得高保真度的响应。我们进行了广泛的实验,包括人工评估和自动评估,涵盖了一个测试场景和四个中英文广泛使用的基准。结果突显了AugCon在生成高多样性、高质量和高保真度SFT数据方面相对于几种最先进方法的显著优势。我们的所有代码、数据集和微调模型将在以下网址提供:https://github.com/quanshr/AugCon。

关键词

引用

@article{arxiv.2405.16579,
  title  = {Automatically Generating Numerous Context-Driven SFT Data for LLMs across Diverse Granularity},
  author = {Shanghaoran Quan},
  journal= {arXiv preprint arXiv:2405.16579},
  year   = {2024}
}