中文

伪装直至成功:面向单语词嵌入任务的自我监督语义偏移

计算与语言 2021-02-02 v1 机器学习

摘要

语言的使用随时间以及跨社会群体与知识领域而发生变化,即便在单语场景下也会导致差异。这种用词上的变异常被称为词汇语义变化(LSC)。LSC 的目标是针对词义刻画并量化语言变异,以衡量两个语言源(即人或语言模型)的差异程度。由于此类任务几乎无可用数据,多数方案涉及无监督方法来对齐两个嵌入并依据距离度量预测语义变化。为此,我们提出一种自我监督方法,通过在输入语料中对词向量引入扰动来生成训练样本,从而建模词汇语义变化。我们表明,我们的方法可用于任意对齐方法下的语义变化检测。此外,它可用于选择对齐中使用的地标词,并相较现有对齐技术带来实质改进。我们利用在三个不同数据集上的实验结果(涉及同义或异义词语)说明了我们技术的效用。我们的方法不仅提供显著改进,还能为 LSC 问题带来新发现。

关键词

引用

@article{arxiv.2102.00290,
  title  = {Fake it Till You Make it: Self-Supervised Semantic Shifts for Monolingual Word Embedding Tasks},
  author = {Maurício Gruppi and Sibel Adalı and Pin-Yu Chen},
  journal= {arXiv preprint arXiv:2102.00290},
  year   = {2021}
}

备注

Published at AAAI-2021