基于ModernBERT的专利语言模型预训练
计算与语言
2025-11-19 v3 人工智能
机器学习
摘要
基于Transformer的语言模型如BERT已成为NLP领域的基础,但在专利等专业领域表现下降,因为专利包含长篇、技术性和法律结构化文本。先前的专利NLP方法主要依赖通用模型微调或使用有限数据进行领域适应变体预训练。在本工作中,我们使用ModernBERT架构和包含超过6000万专利记录的精选语料库,预训练了3个针对专利的特定领域掩码语言模型。我们的方案包含架构优化,包括FlashAttention、旋转嵌入和GLU前馈层。我们在四个下游专利分类任务上进行评估。我们的模型ModernBERT-base-PT在三个数据集上持续优于通用ModernBERT基线,并在三个基线模型中实现竞争性能。额外实验表明,ModernBERT-base-VX和Mosaic-BERT-large的规模化模型和定制化标记化器进一步提升了选定任务的性能。值得注意的是,所有ModernBERT变体均保留了比专利BERT快3倍以上的显著推理速度,凸显其在时间敏感型应用中的适用性。这些结果凸显了针对专利导向NLP任务的特定领域预训练和架构改进的优势。
关键词
引用
@article{arxiv.2509.14926,
title = {Patent Language Model Pretraining with ModernBERT},
author = {Amirhossein Yousefiramandi and Ciaran Cooney},
journal= {arXiv preprint arXiv:2509.14926},
year = {2025}
}
备注
7 pages, 5 figures, 4 tables