僧伽罗语-英语词嵌入对齐:面向低资源语言的数据集与基准的引入
计算与语言
2024-02-09 v1
摘要
自诞生以来,嵌入已成为许多自然语言处理(NLP)任务的主要组成部分,取代了早期的表示形式。尽管多语言嵌入已用于越来越多的多语言任务,但由于并行训练数据的匮乏,诸如僧伽罗语之类的低资源语言往往更关注单语嵌入。当涉及上述多语言任务时,利用这些单语嵌入具有挑战性,因为即使由于相同的训练过程嵌入空间具有相似的几何排列,所考虑语言的嵌入也未对齐。这由嵌入对齐任务解决。即便如此,高资源语言对备受瞩目,而诸如僧伽罗语这样亟需帮助的低资源语言似乎被忽视了。在本文中,我们基于可用的对齐技术尝试对齐僧伽罗语和英语词嵌入空间,并引入僧伽罗语嵌入对齐的基准。此外,作为中间任务,为促进监督对齐,我们还引入了僧伽罗语-英语对齐数据集。这些数据集作为我们监督词嵌入对齐的锚定数据集。尽管我们未获得与法语、德语或汉语等高资源语言可比的结果,我们相信我们的工作为英语和僧伽罗语嵌入之间更专门的对齐奠定了基础。
引用
@article{arxiv.2311.10436,
title = {Sinhala-English Word Embedding Alignment: Introducing Datasets and Benchmark for a Low Resource Language},
author = {Kasun Wickramasinghe and Nisansa de Silva},
journal= {arXiv preprint arXiv:2311.10436},
year = {2024}
}