中文

HinFlair:面向印地语词性标注与文本分类的预训练上下文字符串嵌入

计算与语言 2021-01-19 v1

摘要

基于循环神经网络与 Transformer 架构的语言模型近期在自然语言处理诸多任务(如词性标注、命名实体识别和文本分类)上取得了最先进的结果。然而,这些语言模型大多在英语、德语、西班牙语等高资源语言上预训练。多语言语言模型虽在其训练语料中包含了印地语、泰卢固语、孟加拉语等印度语言,但由于它们并非研究的主要语言,往往难以表征这些语言的语言学特征。我们提出 HinFlair,一种在大型单语印地语语料上预训练的语义表示模型(上下文字符串嵌入)。我们在 6 个文本分类数据集和一个印地语依存树库上开展实验,以分析这些上下文化字符串嵌入在印地语上的表现。结果表明,HinFlair 在文本分类与词性标注等下游任务上优于此前公开可用的最先进预训练嵌入。此外,HinFlair 与 FastText 嵌入结合时,优于许多专为印地语训练的基于 Transformer 的语言模型。

关键词

引用

@article{arxiv.2101.06949,
  title  = {HinFlair: pre-trained contextual string embeddings for pos tagging and text classification in the Hindi language},
  author = {Harsh Patel},
  journal= {arXiv preprint arXiv:2101.06949},
  year   = {2021}
}