中文

Priberam实验室在NTCIR-15 SHINRA2020-ML分类任务中的工作

计算与语言 2021-05-13 v1 机器学习

摘要

维基百科是一个以285种语言提供的在线百科全书。它构成了一个极其重要的知识库(KB),可被自动系统用于多种目的。然而,此类信息的结构与组织不利于自动解析与理解,因此有必要对知识进行结构化。当前SHINRA2020-ML任务的目标是借助维基百科页面,将其对应实体按属于扩展命名实体(ENE)本体的268个层次化类别进行分类。在本工作中,我们提出三种基于多语言BERT所产生上下文嵌入的 distinct 模型。我们探索了带与不带本体层次显式使用的线性层,以及门控循环单元(GRU)层的性能。我们还测试了多种池化策略以利用BERT的嵌入,以及基于标签分数的选择准则。我们能够在多种语言上取得良好性能,包括微调过程中未见过的语言(零样本语言)。

关键词

引用

@article{arxiv.2105.05605,
  title  = {Priberam Labs at the NTCIR-15 SHINRA2020-ML: Classification Task},
  author = {Ruben Cardoso and Afonso Mendes and Andre Lamurias},
  journal= {arXiv preprint arXiv:2105.05605},
  year   = {2021}
}

备注

Presented at NTCIR-15 conference (2020)