中文

用于医学命名实体识别的韩国生物医学语料库 (KBMC)

计算与语言 2024-03-26 v1

摘要

命名实体识别 (NER) 在医学自然语言处理 (NLP) 中发挥着关键作用。然而,此前一直缺乏专门针对韩语的开源医学 NER 数据集。为解决这一问题,我们利用 ChatGPT 辅助构建了 KBMC (Korean Bio-Medical Corpus),现将其公开发布。使用 KBMC 数据集后,我们观察到与在通用韩语 NER 数据集上训练的模型相比,医学 NER 性能显著提升了 20%。本研究强调了使用专门工具和数据集(如 ChatGPT)以增强医疗保健等专业领域语言处理的显著效益与重要性。

关键词

引用

@article{arxiv.2403.16158,
  title  = {Korean Bio-Medical Corpus (KBMC) for Medical Named Entity Recognition},
  author = {Sungjoo Byun and Jiseung Hong and Sumin Park and Dongjun Jang and Jean Seo and Minseok Kim and Chaeyoung Oh and Hyopil Shin},
  journal= {arXiv preprint arXiv:2403.16158},
  year   = {2024}
}