中文

葡萄牙语词义表示:词义嵌入与深度神经语言模型的实验

计算与语言 2021-09-02 v1 机器学习

摘要

词义表示已经超越了 Word2Vec、GloVe 和 FastText 等词表示,并在广泛的自然语言处理任务上取得了创新性的性能。尽管在传统应用中有用,生成词嵌入的传统方法有一个严格的缺陷:它们为给定词产生单一向量表示,忽略了多义词可以具有不同含义的事实。在本文中,我们探索无监督词义表示,与传统词嵌入不同,它们能够通过分析词在文本中的上下文语义来归纳词的不同义项。本文研究的无监督词义表示包括:词义嵌入和深度神经语言模型。我们展示了为葡萄牙语生成词义嵌入的首次实验。我们的实验表明,词义嵌入模型(Sense2vec)在句法和语义类比任务上优于传统词嵌入,证明此处生成的语言资源能够提升葡萄牙语 NLP 任务的性能。我们还评估了预训练深度神经语言模型(ELMo 和 BERT)在两种迁移学习方法下的性能:基于特征和微调,用于语义文本相似度任务。我们的实验表明,微调的多语言及葡萄牙语 BERT 语言模型能够达到比 ELMo 模型和基线更好的准确率。

关键词

引用

@article{arxiv.2109.00025,
  title  = {Sense representations for Portuguese: experiments with sense embeddings and deep neural language models},
  author = {Jessica Rodrigues da Silva and Helena de Medeiros Caseli},
  journal= {arXiv preprint arXiv:2109.00025},
  year   = {2021}
}

备注

24 pages, Springer Nature