《印度之行》:面向印度语言的预训练词嵌入
计算与语言
2021-12-28 v1
摘要
编码词语语义属性的稠密词向量或“词嵌入”现已成为机器翻译(MT)、问答(QA)、词义消歧(WSD)和信息检索(IR)等NLP任务的核心组成部分。在本文中,我们使用多种现有方法为14种印度语言创建多个词嵌入。我们将所有这些语言(即阿萨姆语、孟加拉语、古吉拉特语、印地语、卡纳达语、孔卡尼语、马拉雅拉姆语、马拉地语、尼泊尔语、奥里亚语、旁遮普语、梵语、泰米尔语和泰卢固语)的嵌入置于单一仓库中。强调兼顾上下文的较新方法(BERT、ELMo等)已显示出显著改进,但需大量资源以生成可用模型。我们发布了使用上下文与非上下文方法生成的预训练嵌入。我们还使用MUSE和XLM为上述所有语言对训练跨语言嵌入。为展示我们嵌入的有效性,我们在XPOS、UPOS和NER任务上对所有这些语言评估了我们的嵌入模型。我们使用8种不同方法共发布436个模型。希望它们对资源受限的印度语言NLP有所帮助。本文标题指代E.M.福斯特于1924年首次出版的著名小说《印度之行》。
引用
@article{arxiv.2112.13800,
title = {"A Passage to India": Pre-trained Word Embeddings for Indian Languages},
author = {Kumar Saurav and Kumar Saunack and Diptesh Kanojia and Pushpak Bhattacharyya},
journal= {arXiv preprint arXiv:2112.13800},
year = {2021}
}
备注
Published at LREC 2020