专利领域用于表征学习的语言信息感知掩码
计算与语言
2021-06-11 v1 信息检索
摘要
领域特定的上下文语言模型已在领域特定的下游任务(如相似度匹配、实体识别或信息检索)中展现出显著的效果提升。然而,在高度特定的语言领域中成功应用此类模型需要对预训练模型进行领域适配。本文提出经验驱动的“语言信息感知掩码”(LIM)方法,将领域自适应预训练聚焦于专利的语言模式,专利使用高度技术化的子语言。我们量化了专利语言、科学语言与通用语言之间的相关差异,并针对两种不同语言模型(BERT 和 SciBERT)证明,使用 LIM 进行领域适配通过在两个独立下游任务(IPC 分类和相似度匹配)上评估专利语言的领域适配表征,带来了系统性的表征改进。我们展示了在专利领域领域适配期间平衡不同信息源学习的影响。我们在 https://github.com/sophiaalthammer/patent-lim 公开了源代码以及领域自适应预训练的专利语言模型。
引用
@article{arxiv.2106.05768,
title = {Linguistically Informed Masking for Representation Learning in the Patent Domain},
author = {Sophia Althammer and Mark Buckley and Sebastian Hofstätter and Allan Hanbury},
journal= {arXiv preprint arXiv:2106.05768},
year = {2021}
}
备注
Published at SIGIR 2021 PatentSemTech workshop