Raw Text是唯一需要的:面向大语言模型的知识密集型多轮指令调优
计算与语言
2024-07-04 v1 人工智能
摘要
指令调优是一种有效的技术,用于将大型语言模型(LLM)的输出与人类偏好相匹配。但如何从原始文档生成季节性多轮对话以进行指令调优仍需进一步探索。本文提出了名为R2S的 novel 框架,该框架利用CoD-Chain of Dialogue logic指导大型语言模型(LLM)为指令调优生成知识密集型多轮对话。通过将来自开源数据集和特定领域的web爬取文档整合到基准K-BENCH中,我们涵盖了诸如维基百科(英文)、科学(中文)和制品(中文)等 diverse 领域。我们的 method 首先决定当前对话的逻辑流程,然后提示LLM为获取相关 response 内容而产生关键短语。这种方法使我们能够创建G I NSTRUCT instruction dataset,保留 raw document knowledge within dialoguestyle interactions。通过使用该数据集,我们微调了GLLM,这是一个设计用于将原始文档转换为结构化多轮对话的模型,从而将 comprehensive 领域知识注入SFT model以获得更好的指令调优。本 work 标志着向改进LLMs在处理和生成更准确、上下文细致的 response方面的适应性和有效性迈出了一步。
引用
@article{arxiv.2407.03040,
title = {Raw Text is All you Need: Knowledge-intensive Multi-turn Instruction Tuning for Large Language Model},
author = {Xia Hou and Qifeng Li and Jian Yang and Tongliang Li and Linzheng Chai and Xianjie Wu and Hangyuan Ji and Zhoujun Li and Jixuan Nie and Jingbo Dun and Wenfeng Song},
journal= {arXiv preprint arXiv:2407.03040},
year = {2024}
}
备注
11 pages, 3 figures