中文

Flacuna:利用 FLAN 微调释放 Vicuna 的问题求解能力

计算与语言 2023-07-06 v1

摘要

近期,INSTRUCTEVAL 的发布为采用编码器-解码器或仅解码器架构的大语言模型(LLMs)性能提供了宝贵见解。有趣的是,尽管基于 T5 的 LLM(如 FLAN-T5)在四年前就已提出,但在需要通用问题求解能力的任务上,其表现仍优于最新的基于解码器的 LLM(如 LLAMA 和 VICUNA)。这一性能差异可归因于三个关键因素:(1)预训练数据,(2)主干架构,以及(3)指令数据集。在本技术报告中,我们的主要聚焦于考察第三个因素的影响,具体借助基于 LLAMA 并在 ChatGPT 对话上微调过的大语言模型 VICUNA。为实现该目标,我们使用名为 FLANMINI 的定制化指令数据集集合对 VICUNA 进行微调。该集合包含大规模指令数据集 FLAN 的一个子集,以及源自 ChatGPT/GPT-4 的多种代码相关数据集与对话数据集。此数据集涵盖大量需要问题求解能力的任务。我们的实验结果表明,我们的模型 FLACUNA 所增强的问题求解能力,是通过在 FLAN 数据集上微调 VICUNA 获得的,从而在 INSTRUCTEVAL 的众多基准数据集上取得显著提升。FLACUNA 已在 https://huggingface.co/declare-lab/flacuna-13b-v1.0 公开可用。

关键词

引用

@article{arxiv.2307.02053,
  title  = {Flacuna: Unleashing the Problem Solving Power of Vicuna using FLAN Fine-Tuning},
  author = {Deepanway Ghosal and Yew Ken Chia and Navonil Majumder and Soujanya Poria},
  journal= {arXiv preprint arXiv:2307.02053},
  year   = {2023}
}