中文

基于领域特定小语言模型的跨域内容生成

计算与语言 2024-10-03 v2 人工智能

摘要

使用小型语言模型生成领域特定内容面临着挑战,尤其是当处理多个彼此之间重叠最小化的不同数据集时。在本研究中,我们探索了方法,使小型语言模型能够为两个不同领域(故事数据集A和食谱数据集B)生成连贯且相关的输出。我们的初始实验表明,针对每个数据集训练单独的模型会产生满意的结果,每个模型都能在其所属领域内生成适当的内容。我们发现,利用针对每个数据集量身定制的分词器,比使用通用分词器显著提升了生成质量。尝试使用低秩适应(LoRA)或标准微调来适应单个模型以处理两个领域并不产生实质性结果,往往无法生成有意义的输出。此外,在不冻结模型现有权重的情况下进行完整微调会导致灾难性遗忘,即模型丢失先前学习的知识,仅保留来自新数据的知识。为克服这些挑战,我们采用知识扩展策略:仅使用额外参数进行训练。这种方法使模型能够按需生成故事和食谱,有效地处理多个领域,而不受灾难性遗忘的影响。我们的发现表明,带有冻结层的知识扩展是小型语言模型在不同数据集上生成领域特定内容的有效方法。本工作推动了高效多域语言模型的发展,并为在小型架构中管理灾难性遗忘提供了见解。

关键词

引用

@article{arxiv.2409.17171,
  title  = {Cross-Domain Content Generation with Domain-Specific Small Language Models},
  author = {Ankit Maloo and Abhinav Garg},
  journal= {arXiv preprint arXiv:2409.17171},
  year   = {2024}
}

备注

15 pages