面向大语言模型的混合损失:双目标优化以提升领域专长与保持通用能力
计算与语言
2025-05-21 v2
摘要
虽然大语言模型(LLMs)在通用任务上表现良好,但在特定领域应用中仍受到幻觉现象和准确性限制的制约。持续预训练(CPT)方法面临两个关键问题:(1) 领域偏向数据会降低通用语言技能;(2) 不当的语料混合比例限制了有效适应。为此,我们提出了一种新框架——损失混合(Mixture of Losses, MoL)——通过解耦领域专用语料和通用语料的优化目标来应对上述挑战。具体而言,交叉熵损失(CE loss)用于领域语料以确保知识获取,而KL散度用于将通用语料训练与基础模型的核心能力进行对齐。这种双损失架构既保留了普适技能,又提升了领域专长,避免了灾难性遗忘。实验结果表明,领域语料与通用语料比例为1:1时,可最佳平衡训练效果与过拟合,无需 extensive 调参或资源密集型实验。进一步地,我们的实验显示,与传统CPT方法相比,本方法在非思考模式下的 Math-500基准测试中准确率提升27.9%,在思考模式下的 AIME25子集上提升83.3%,凸显了该方法的有效性。
引用
@article{arxiv.2505.12043,
title = {MoL for LLMs: Dual-Loss Optimization to Enhance Domain Expertise While Preserving General Capabilities},
author = {Jingxue Chen and Qingkun Tang and Qianchun Lu and Siyuan Fang},
journal= {arXiv preprint arXiv:2505.12043},
year = {2025}
}