中文

利用对比学习注入 Wiktionary 以改进词元级上下文表示

计算与语言 2024-02-13 v1

摘要

虽然静态词嵌入对上下文不敏感,但在词汇语义任务中,上下文在上下文词嵌入中又显得过于存在,导致相同含义出现的向量差异过大(Ethayarajh, 2019)。此前有人提出利用对比学习微调预训练语言模型(PLMs),并利用自动自增强样本(Liu et al., 2021b)。在本文中,我们研究了如何注入词典作为另一种监督来源,使用的是英语 Wiktionary。我们还测试了降维对生成的上下文词嵌入的影响。我们在无监督设置下(不使用训练集)在上下文中的词(WiC)任务上评估了我们的方法。我们在原始 WiC 测试集上取得了新的最先进(SoTA)结果。我们还提出了两个新的 WiC 测试集,并表明我们的微调方法在这些测试集上取得了显著改进。我们还观察到在语义框架归纳任务上有所改进,尽管幅度适中。虽然我们在英语上进行了实验以便与相关工作进行比较,但我们的方法可适用于拥有大型 Wiktionary 的多种语言。

关键词

引用

@article{arxiv.2402.07817,
  title  = {Injecting Wiktionary to improve token-level contextual representations using contrastive learning},
  author = {Anna Mosolova and Marie Candito and Carlos Ramisch},
  journal= {arXiv preprint arXiv:2402.07817},
  year   = {2024}
}

备注

Accepted to EACL 2024 (Main)