解码马来西亚英语新闻:一种用于命名实体与关系抽取的语言资源
计算与语言
2024-02-23 v1
摘要
标准英语与马来西亚英语存在显著差异,这给马来西亚英语的自然语言处理 (NLP) 任务带来了挑战。不幸的是,现有数据集大多基于标准英语,因此不足以改善马来西亚英语的 NLP 任务。一项在马来西亚英语新闻文章上使用最先进命名实体识别 (NER) 解决方案的实验表明,它们无法处理马来西亚英语中的形态句法变异。据我们所知,目前尚无用于改进模型的标注数据集。为解决这些问题,我们构建了马来西亚英语新闻 (MEN) 数据集,其中包含 200 篇手动标注了实体和关系的新闻文章。随后,我们微调了 spaCy NER 工具,并验证了拥有专为马来西亚英语定制的数据集可显著提升马来西亚英语中 NER 的性能。本文介绍了我们在数据采集、标注方法论以及对标注数据集的详尽分析方面的工作。为验证标注质量,使用了标注者间一致性评估,随后由领域专家对分歧进行裁决。完成这些任务后,我们成功开发了一个包含 6,061 个实体和 3,268 个关系实例的数据集。最后,我们讨论了 spaCy 微调设置及对 NER 性能的分析。这一独特的数据集将极大地推动马来西亚英语 NLP 研究的发展,使研究人员能够加速其进展,特别是在 NER 和关系抽取方面。该数据集及标注指南已发布在 Github 上。
引用
@article{arxiv.2402.14521,
title = {Malaysian English News Decoded: A Linguistic Resource for Named Entity and Relation Extraction},
author = {Mohan Raj Chanthran and Lay-Ki Soon and Huey Fang Ong and Bhawani Selvaretnam},
journal= {arXiv preprint arXiv:2402.14521},
year = {2024}
}
备注
Accepted at LREC-COLING 2024