TEAM-Atreides 在 SemEval-2022 任务 11 上的工作:利用数据增强与集成识别孟加拉语复杂命名实体
计算与语言
2022-04-22 v1
摘要
许多领域,如生物与医疗领域、艺术作品以及机构名称,包含嵌套、重叠、不连续的实体提及,这些提及在实践中甚至可能在句法或语义上存在歧义。传统的序列标注算法无法识别这些复杂提及,因为它们可能违背序列标注方案所基于的假设。在本文中,我们描述了在 SemEval 2022 任务 11 中识别此类复杂命名实体的贡献。我们利用多个仅在孟加拉语上专门预训练的基于 ELECTRA 的模型与在英语上预训练的基于 ELECTRA 的模型的集成,以在 Track-11 上取得具有竞争力的性能。除提供系统描述外,我们还将展示关于架构决策、数据集增强和赛后发现的实验结果。
引用
@article{arxiv.2204.09964,
title = {TEAM-Atreides at SemEval-2022 Task 11: On leveraging data augmentation and ensemble to recognize complex Named Entities in Bangla},
author = {Nazia Tasnim and Md. Istiak Hossain Shihab and Asif Shahriyar Sushmit and Steven Bethard and Farig Sadeque},
journal= {arXiv preprint arXiv:2204.09964},
year = {2022}
}
备注
accepted in Proceedings of the 16th International Workshop on Semantic Evaluation