搅合起来:多任务微调对 LLM 性能的鸡尾酒效应——以金融领域为例
人工智能
2024-12-06 v2 计算工程、金融与科学
计算与语言
摘要
大语言模型(LLM)在特定领域应用,如金融领域,其应用范围迅速扩大。特定领域的 LLM 通常基于其在领域相关下游任务的性能进行评估。在本工作中,我们对为此类任务进行 LLM 微调进行了详细分析。有趣的是,我们发现在特定领域的情况下,仅针对目标任务进行微调并不总是最有效的策略。相反,多任务微调——即模型在一组相关任务上的训练——可以显著提升性能。我们展示了这种方法使小型模型(如 Phi-3-Mini)能够实现最先进的结果,甚至在金融基准测试中超越了规模更大的 GPT-4-o 模型。我们的研究涉及大规模实验,使用几种广泛采用的 LLM 作为基线进行超过 200 次训练实验,实证确认了多任务微调的优势。此外,我们探讨了将通用指令数据作为正则化手段的使用,表明这有助于最小化性能下降。我们还调查了包括数学数据在内的因素,发现其在数值推理方面的改进能够有效转移到金融任务中。最后,我们指出,针对下游任务进行微调会导致任务性能的针对性改进,但并不一定导致更广泛的领域知识或复杂领域推理能力的提升。
引用
@article{arxiv.2410.01109,
title = {Mixing It Up: The Cocktail Effect of Multi-Task Fine-Tuning on LLM Performance -- A Case Study in Finance},
author = {Meni Brief and Oded Ovadia and Gil Shenderovitz and Noga Ben Yoash and Rachel Lemberg and Eitam Sheetrit},
journal= {arXiv preprint arXiv:2410.01109},
year = {2024}
}