中文

GILE:一种用于文本分类的广义输入-标签嵌入

计算与语言 2019-01-31 v3

摘要

神经文本分类模型通常将输出标签视为缺乏描述与语义的类别变量。这迫使它们的参数化依赖于标签集大小,因此无法扩展到大型标签集并泛化到未见过的标签。现有的联合输入-标签文本模型通过利用标签描述克服了这些问题,但它们无法捕捉复杂的标签关系,具有僵化的参数化,且其在未见标签上的提升常以训练时可见标签上的弱性能为代价。本文中,我们提出一种新的输入-标签模型,它推广了先前的此类模型,解决了其局限性,且不在可见标签上折损性能。该模型由一个具有可控容量的联合非线性输入-标签嵌入,以及一个在联合空间依赖的分类单元组成,后者以交叉熵损失训练以优化分类性能。我们在具有大型标签集的多语种新闻与生物医学文本的全资源及低资源或零资源文本分类上评估模型。我们的模型在两种场景下均优于不利用标签语义的单语种与多语种模型,以及先前的联合输入-标签空间模型。

关键词

引用

@article{arxiv.1806.06219,
  title  = {GILE: A Generalized Input-Label Embedding for Text Classification},
  author = {Nikolaos Pappas and James Henderson},
  journal= {arXiv preprint arXiv:1806.06219},
  year   = {2019}
}

备注

To appear in TACL