金融领域合并持续预训练模型以构建领域专业型大语言模型:案例研究
计算与语言
2025-11-05 v1
摘要
虽然大语言模型在通用任务中表现出色,但在专业领域如金融领域时常力不及众,需要涵盖领域知识、数学推理和多语言处理等多项技能。从领域专家处合并持续预训练(CPT)模型为构建专业型大语言模型提供了实用替代方案,避免了高成本和不稳定的多技能训练。然而,与已建立的基于监督微调(SFT)模型的模型合并方法不同,CPT模型的合并研究仍鲜有探索。我们通过创建来自金融、数学和日语专家的模型,来填补这一空白。我们提出一个三阶段评估框架,聚焦知识恢复、互补性和涌现性,并在来自18个任务、8个成熟数据集的全面金融基准测试中评估三种合并方法(Task Arithmetic、TIES和DARE-TIES)。结果表明,与其基模型合并的专家能恢复CPT期间丢失的通用知识,而合并多个专家可提升性能并可能产生涌现的跨领域技能。三种方法中,Task Arithmetic表现强劲但对超参数较为敏感,而TIES更稳健。我们的发现还表明,虽然模型相似度与合并成功相关,但涌现技能依赖于更为复杂的因素。这项工作首次对CPT模型合并进行根本性分析,确立原则框架并为从现有资产构建多技能大语言模型提供明确指导。
引用
@article{arxiv.2511.02451,
title = {Merging Continual Pretraining Models for Domain-Specialized LLMs: A Case Study in Finance},
author = {Kentaro Ueda and François Portet and Hirohiko Suwa and Keiichi Yasumoto},
journal= {arXiv preprint arXiv:2511.02451},
year = {2025}
}