ManufactuBERT:面向制造业的高效持续预训练
计算与语言
2025-11-10 v1
摘要
虽然大型基于Transformer的通用编码器在通用语言理解方面表现优异,但由于缺乏针对制造等专业领域术语和语义的暴露,其性能在该类领域会有所下降。本文通过引入ManufactuBERT——一个在为制造领域精选的大规模语料库上持续预训练的RoBERTa模型——来弥补这一差距。我们提出了完整的数据处理管道,从网页数据中创建该语料库,包括基于领域的过滤步骤 followed by 多级去重过程以消除冗余。我们的实验表明,ManufactuBERT 在一系列制造相关NLP任务上取得了新的状态最佳成绩,超越了强大的专业基线。更重要的是,我们证明,在我们精心去重的语料库上进行训练可显著加快收敛速度,相较于在非去重数据集上训练,训练时间和计算成本分别降低约33%。该管道为开发其他专业领域的高性能编码器提供了可复现的示例。我们将在 https://huggingface.co/cea-list-ia 上发布该模型和精选语料库。
引用
@article{arxiv.2511.05135,
title = {ManufactuBERT: Efficient Continual Pretraining for Manufacturing},
author = {Robin Armingaud and Romaric Besançon},
journal= {arXiv preprint arXiv:2511.05135},
year = {2025}
}
备注
Submitted to LREC 2026