中文

拥抱歧义:利用上下文同义知识改进面向相似度的任务

计算与语言 2024-10-28 v1

摘要

上下文同义知识对于那些核心挑战在于捕获实体在上下文中语义相似度的面向相似度任务(如实体链接与实体匹配)至关重要。然而,大多数预训练语言模型(PLM)因预训练目标(如掩码语言建模(MLM))的固有局限而缺乏同义知识。现有将同义知识注入 PLM 的工作常存在两个严重问题:(i) 忽视同义词的歧义性;(ii) 损害原始 PLM 的语义理解,这是由同义词的精确语义相似度与从原始语料学到的宽泛概念关联间的不一致所致。为解决这些问题,我们提出 PICSO,一种灵活框架,通过新颖的实体感知 Adapter 将多领域上下文同义知识注入 PLM,该 Adapter 关注上下文中实体(同义词)的语义。同时,PICSO 将同义知识存于 Adapter 结构的额外参数中,防止其破坏原始 PLM 的语义理解。大量实验表明,PICSO 在四个不同面向相似度任务上大幅优于原始 PLM 及其他知识与同义注入模型。此外,GLUE 上的实验证明 PICSO 也有益于通用自然语言理解任务。代码与数据将公开。

关键词

引用

@article{arxiv.2211.10997,
  title  = {Embracing Ambiguity: Improving Similarity-oriented Tasks with Contextual Synonym Knowledge},
  author = {Yangning Li and Jiaoyan Chen and Yinghui Li and Tianyu Yu and Xi Chen and Hai-Tao Zheng},
  journal= {arXiv preprint arXiv:2211.10997},
  year   = {2024}
}

备注

This work has been submitted to the Neurocomputing