中文

TEAM-Atreides 在 SemEval-2022 任务 11 上的工作:利用数据增强与集成识别孟加拉语复杂命名实体

计算与语言 2022-04-22 v1

摘要

许多领域,如生物与医疗领域、艺术作品以及机构名称,包含嵌套、重叠、不连续的实体提及,这些提及在实践中甚至可能在句法或语义上存在歧义。传统的序列标注算法无法识别这些复杂提及,因为它们可能违背序列标注方案所基于的假设。在本文中,我们描述了在 SemEval 2022 任务 11 中识别此类复杂命名实体的贡献。我们利用多个仅在孟加拉语上专门预训练的基于 ELECTRA 的模型与在英语上预训练的基于 ELECTRA 的模型的集成,以在 Track-11 上取得具有竞争力的性能。除提供系统描述外,我们还将展示关于架构决策、数据集增强和赛后发现的实验结果。

关键词

引用

@article{arxiv.2204.09964,
  title  = {TEAM-Atreides at SemEval-2022 Task 11: On leveraging data augmentation and ensemble to recognize complex Named Entities in Bangla},
  author = {Nazia Tasnim and Md. Istiak Hossain Shihab and Asif Shahriyar Sushmit and Steven Bethard and Farig Sadeque},
  journal= {arXiv preprint arXiv:2204.09964},
  year   = {2022}
}

备注

accepted in Proceedings of the 16th International Workshop on Semantic Evaluation