利用对比学习注入 Wiktionary 以改进词元级上下文表示
计算与语言
2024-02-13 v1
摘要
虽然静态词嵌入对上下文不敏感,但在词汇语义任务中,上下文在上下文词嵌入中又显得过于存在,导致相同含义出现的向量差异过大(Ethayarajh, 2019)。此前有人提出利用对比学习微调预训练语言模型(PLMs),并利用自动自增强样本(Liu et al., 2021b)。在本文中,我们研究了如何注入词典作为另一种监督来源,使用的是英语 Wiktionary。我们还测试了降维对生成的上下文词嵌入的影响。我们在无监督设置下(不使用训练集)在上下文中的词(WiC)任务上评估了我们的方法。我们在原始 WiC 测试集上取得了新的最先进(SoTA)结果。我们还提出了两个新的 WiC 测试集,并表明我们的微调方法在这些测试集上取得了显著改进。我们还观察到在语义框架归纳任务上有所改进,尽管幅度适中。虽然我们在英语上进行了实验以便与相关工作进行比较,但我们的方法可适用于拥有大型 Wiktionary 的多种语言。
引用
@article{arxiv.2402.07817,
title = {Injecting Wiktionary to improve token-level contextual representations using contrastive learning},
author = {Anna Mosolova and Marie Candito and Carlos Ramisch},
journal= {arXiv preprint arXiv:2402.07817},
year = {2024}
}
备注
Accepted to EACL 2024 (Main)