中文

冠状病毒新闻的细粒度命名实体

计算与语言 2024-04-25 v1

摘要

信息资源如报纸自 2019 年 12 月起生产与冠状病毒爆发相关的各种语言的非结构化文本数据。没有将其表示为结构化格式的情况下,对这些非结构化文本进行分析是耗时的;因此,将其表示为结构化格式至关重要。可能应用于这些文本的以命名实体标记和关系抽取为核心任务的信息抽取管道可能实现这一目标。这项研究提出了一个数据标注管道,用于从冠状病毒新闻文章中生成训练数据,包括通用实体和特定于领域的实体。对在该标注语料库上训练的命名实体识别模型进行训练,然后在由领域专家手动标注的测试句子上对其进行评估,以评估训练模型的性能。代码库和演示可在 https://github.com/sefeoglu/coronanews-ner.git 提供。

关键词

引用

@article{arxiv.2404.13439,
  title  = {Fine-Grained Named Entities for Corona News},
  author = {Sefika Efeoglu and Adrian Paschke},
  journal= {arXiv preprint arXiv:2404.13439},
  year   = {2024}
}

备注

Published at SWAT4HCLS 2023: The 14th International Conference on Semantic Web Applications and Tools for Health Care and Life Sciences