TransformLLM:通过大语言模型转换的阅读理解文本适配大语言模型
计算与语言
2024-10-30 v1 人工智能
机器学习
摘要
大语言模型(LLMs)在高度专业化的领域展现了潜力,然而在准确性和成本方面仍存在挑战。这些限制制约了现有模型在特定领域任务中的使用。虽然微调预训练模型已显示出有希望的结果,但这一过程可能计算成本高昂,并且需要手头专业应用的海量数据集。在这项工作中,我们弥合了这一差距。我们开发了 Phi-2-Legal 和 Mistral-Legal-7B,它们是专为法律应用设计的语言模型。这些模型基于 Phi-2 和 Mistral-7B-v0.1,并使用超过 5 亿个法律文本 token 进行了持续预训练。我们的创新方法通过使用大语言模型(LLMs)将原始训练数据转换为阅读理解文本,显著提升了法律任务中的能力。我们的法律 LLM 在法律基准测试中表现出卓越的性能,甚至优于在更大数据集上以更多资源训练的模型。这项工作强调了在领域特定文本上进行持续预训练的有效性,同时使用经济实惠的 LLM 进行数据转换,这赋予了这些模型领域专业知识,同时保留了通用语言理解能力。虽然这项工作以法律领域作为测试用例,但我们的方法可以扩展并应用于任何预训练数据集,从而在不同任务中带来显著改进。这些发现突出了领域自适应预训练和阅读理解在开发高效领域特定语言模型方面的潜力。
引用
@article{arxiv.2410.21479,
title = {TransformLLM: Adapting Large Language Models via LLM-Transformed Reading Comprehension Text},
author = {Iftach Arbel and Yehonathan Refael and Ofir Lindenbaum},
journal= {arXiv preprint arXiv:2410.21479},
year = {2024}
}