中文

用于零样本跨语言文本分类的多语言实体袋模型

计算与语言 2022-10-12 v2

摘要

我们提出了一种多语言实体袋模型,该模型通过扩展多语言预训练语言模型(例如 M-BERT),有效提升了零样本跨语言文本分类的性能。它利用了 Wikidata 的多语言特性:表示同一概念的多种语言实体被定义为一个唯一标识符。这使得用多种语言描述的实体能够使用共享嵌入来表示。因此,在资源丰富语言上基于实体特征训练的模型可以直接应用于其他语言。我们在跨语言主题分类(使用 MLDoc 和 TED-CLDC 数据集)和实体分型(使用 SHINRA2020-ML 数据集)上的实验结果表明,所提出的模型始终优于最先进的模型。

关键词

引用

@article{arxiv.2110.07792,
  title  = {A Multilingual Bag-of-Entities Model for Zero-Shot Cross-Lingual Text Classification},
  author = {Sosuke Nishikawa and Ikuya Yamada and Yoshimasa Tsuruoka and Isao Echizen},
  journal= {arXiv preprint arXiv:2110.07792},
  year   = {2022}
}

备注

Accepted to CoNLL 2022