中文

德语工业领域的高效领域自适应持续预训练

计算与语言 2025-07-02 v3

摘要

领域自适应持续预训练(DAPT)是一种最先进的技术,旨在在无法通过标准领域适应(如通过语言模型微调)获取标记任务数据时,对语言模型(LM)进行进一步训练。虽然此方法流行,但掩码语言模型(MLM)需要大量与领域相关的数据,而对于以英语以外的语言(如德语)的特定领域(如工业领域)来说,这类数据难以获取。本文引入一种高效方法,称为 ICL 增强预训练(ICL-APT),该方法利用情境学习(ICL)和 k 近邻(kNN)来增强目标数据中包含与领域相关且领域内文本的数据,从而显著减少 GPU 时间,同时保持强大的模型性能。我们的结果表明,ICL-APT 的最佳配置比最先进的 DAPT 高出 28.7%(提升 7.87 分),且几乎只需 1/4 的 GPU 计算时间,为计算资源有限的行业提供了具有成本效益的解决方案。本研究突显了该框架在其他低资源行业中的更广泛适用性,使基于 NLP 的解决方案在生产环境中更加可及和可行。

关键词

引用

@article{arxiv.2504.19856,
  title  = {Efficient Domain-adaptive Continual Pretraining for the Process Industry in the German Language},
  author = {Anastasia Zhukova and Christian E. Matt and Bela Gipp},
  journal= {arXiv preprint arXiv:2504.19856},
  year   = {2025}
}

备注

accepted to TSD 2025