中文

用于指令微调大语言模型的无种子合成数据框架:以泰语为例

计算与语言 2024-11-26 v1

摘要

我们提出了一种合成数据方法,用于以数据高效的方式为低资源语言指令微调大语言模型(LLM),并特别关注泰语。我们确定了有助于指令微调数据集有效性的三个关键属性:流畅性、多样性和文化背景。我们提出了一个无种子数据框架,用于生成包含这些基本属性的合成指令微调数据。我们的框架利用LLM生成多样化的主题,从维基百科检索相关上下文,并为各种任务(如问答、摘要和对话)创建指令。实验结果表明,我们性能最佳的合成数据集融合了所有三个关键属性,仅使用5,000条指令即可达到与在数十万条指令上训练的最先进泰语LLM相媲美的性能。我们的代码和数据集可在 https://github.com/parinzee/seed-free-synthetic-instruct 公开获取。

引用

@article{arxiv.2411.15484,
  title  = {Seed-Free Synthetic Data Generation Framework for Instruction-Tuning LLMs: A Case Study in Thai},
  author = {Parinthapat Pengpun and Can Udomcharoenchaikit and Weerayut Buaphet and Peerat Limkonchotiwat},
  journal= {arXiv preprint arXiv:2411.15484},
  year   = {2024}
}

备注

ACL-SRW 2024. Our code and dataset are publicly available at https://github.com/parinzee/seed-free-synthetic-instruct