中文

面向AEC领域通用信息检索任务的预训练领域专用语言模型

计算与语言 2022-06-22 v1 人工智能 机器学习

摘要

作为建筑、工程与施工(AEC)行业的一项基本任务,基于自然语言处理(NLP)从非结构化文本数据中检索信息(IR)正受到越来越多的关注。尽管AEC领域中已有多种用于IR任务的深度学习(DL)模型被研究,但领域语料与领域专用预训练DL模型如何在各类IR任务中提升性能仍不明确。为此,本文系统探究了领域语料与多种迁移学习技术对IR任务DL模型性能的影响,并提出了一种面向AEC领域的预训练领域专用语言模型。首先,构建了领域内与邻近领域语料。随后,基于不同领域语料与迁移学习策略,预训练了包括传统词嵌入模型与基于BERT的模型在内的两类预训练模型。最后,基于不同配置与预训练模型,对若干广泛使用的IR任务DL模型进行了进一步训练与测试。结果表明,领域语料对传统词嵌入模型在文本分类与命名实体识别任务上具有相反的影响,但能进一步提升基于BERT的模型在所有任务中的性能。同时,基于BERT的模型在所有IR任务中大幅优于传统方法,其F1分数最大分别提升5.4%与10.1%。本研究从两方面贡献于知识体系:1)展示了领域语料与预训练DL模型的优势;2)据我们所知,首次公开了面向AEC领域的领域专用数据集与预训练语言模型。因此,本工作为预训练模型在AEC领域的采纳与应用提供了启示。

关键词

引用

@article{arxiv.2203.04729,
  title  = {Pretrained Domain-Specific Language Model for General Information Retrieval Tasks in the AEC Domain},
  author = {Zhe Zheng and Xin-Zheng Lu and Ke-Yin Chen and Yu-Cheng Zhou and Jia-Rui Lin},
  journal= {arXiv preprint arXiv:2203.04729},
  year   = {2022}
}