中文

Bailong:基于 QLoRA 与拉链式嵌入的双语迁移学习

计算与语言 2024-04-02 v1 人工智能

摘要

大型语言模型(LLMs)在各种 NLP 应用中展现出卓越性能。然而,现有大多数开源 LLMs 主要在英文数据及少量其他语言数据上进行预训练。多语言训练数据的缺乏导致其在应用于可用资源较少的语言时性能欠佳。此外,通过全参数微调并利用额外数据来提升 LLMs 在低资源语言上的性能需要大量计算资源,这给研究机构和个人研究者带来了计算壁垒。因此,人们提出了参数高效微调和高级嵌入初始化等技术来应对这些挑战。在本工作中,我们将二者结合,以促进以英语为主导的开源 LLM 的跨语言迁移。为了有效提升模型在繁体中文方面的能力,我们利用 QLoRA 和我们提出的拉链式嵌入初始化,使用繁体中文数据对 Llama 2 7B 进行了二次预训练。由此产生的模型称为 Bailong,代表基于 qLOra 和拉链式嵌入的双语迁移学习。我们推出了 Bailong-instruct 7B,这是 Bailong 7B 的微调版本,针对多轮对话场景进行了优化。认识到繁体中文基准数据集的不足,我们进一步引入了 Bailong-bench,以评估模型与人类偏好的对齐程度以及在繁体中文和英文任务中遵循指令的能力。在我们的评估中,与其他参数规模相似甚至更大的开源模型相比,Bailong-instruct 7B 在 Bailong-bench 及其他基准数据集上展现出具有竞争力的性能。Bailong-instruct 7B 和 Bailong-bench 已公开发布,旨在赋能社区在我们的工作基础上继续发展。

关键词

引用

@article{arxiv.2404.00862,
  title  = {Bailong: Bilingual Transfer Learning based on QLoRA and Zip-tie Embedding},
  author = {Lung-Chuan Chen and Zong-Ru Li},
  journal= {arXiv preprint arXiv:2404.00862},
  year   = {2024}
}