Sem4SAP:从开放知识图谱中挖掘同义表达用于语言模型的同义感知预训练
计算与语言
2023-03-28 v1 人工智能
摘要
模型理解同义表达的能力在许多下游任务中至关重要。它会使模型更好地理解上下文之间的相似性,并对同义替换攻击更具鲁棒性。然而,许多预训练语言模型(PLM)由于小规模同义词集和PLM预训练目标的限制而缺乏同义知识。在本文中,我们提出了一个称为Sem4SAP的框架,用于从开放知识图谱(Open-KG)中挖掘同义词集,并利用挖掘出的同义词集对语言模型进行同义感知预训练。我们提出对Open-KG中的内容进行粗过滤,并利用频率信息在低资源无监督条件下更好地辅助聚类过程。我们通过在同义表达之间迁移核心语义来扩展挖掘出的同义词集。我们还提出了两种新颖有效的同义感知预训练方法,用于将同义知识注入PLM中。大量实验表明,Sem4SAP在十个不同任务上大幅优于原始PLM和其他基线。
引用
@article{arxiv.2303.14425,
title = {Sem4SAP: Synonymous Expression Mining From Open Knowledge Graph For Language Model Synonym-Aware Pretraining},
author = {Zhouhong Gu and Sihang Jiang and Wenhao Huang and Jiaqing Liang and Hongwei Feng and Yanghua Xiao},
journal= {arXiv preprint arXiv:2303.14425},
year = {2023}
}