一种基于 RAG 与自微调生成指令数据集的新型管道
计算与语言
2024-08-13 v1 人工智能
摘要
近年来,大语言模型的快速发展导致对满足企业和组织特定需求的领域专用智能体日益增长。不同于追求广泛覆盖的通用模型,这些专业智能体依赖针对其预期应用的聚焦数据集。本研究提出一种管道,利用大语言模型的强大能力和检索增强生成(RAG)相关框架,构建针对特定领域使用自定义文档集合进行微调的高质量指令数据集。通过摄取领域特定文档,该管道生成相关且情境恰当的指令,从而有效地为在目标领域对大语言模型进行微调创建全面的数据集。这种方法克服了传统数据创建方法的局限性,这些方法常依赖人工精选或网页抓取技术,可能引入噪声和无关数据。值得注意的是,我们的管道提供了一个动态解决方案,能够快速适应领域特定文档集合的更新或修改,无需重新进行完整训练。此外,它解决了数据稀缺问题,使其适用于数据集稀缺的不普遍或专业领域。作为案例研究,我们将此方法应用于精神医学领域,该领域需要专业知识并妥善处理患者信息。最终得到的微调大语言模型展示了所提出方法的可行性,并凸显了其在各种行业和领域中广泛采纳的潜力。
引用
@article{arxiv.2408.05911,
title = {A New Pipeline For Generating Instruction Dataset via RAG and Self Fine-Tuning},
author = {Chih-Wei Song and Yu-Kai Lee and Yin-Te Tsai},
journal= {arXiv preprint arXiv:2408.05911},
year = {2024}
}
备注
5 pages, SCA 2024: The 7th IEEE International Workshop on Smart Computing & Applications