用于医学命名实体识别的韩国生物医学语料库 (KBMC)
计算与语言
2024-03-26 v1
摘要
命名实体识别 (NER) 在医学自然语言处理 (NLP) 中发挥着关键作用。然而,此前一直缺乏专门针对韩语的开源医学 NER 数据集。为解决这一问题,我们利用 ChatGPT 辅助构建了 KBMC (Korean Bio-Medical Corpus),现将其公开发布。使用 KBMC 数据集后,我们观察到与在通用韩语 NER 数据集上训练的模型相比,医学 NER 性能显著提升了 20%。本研究强调了使用专门工具和数据集(如 ChatGPT)以增强医疗保健等专业领域语言处理的显著效益与重要性。
引用
@article{arxiv.2403.16158,
title = {Korean Bio-Medical Corpus (KBMC) for Medical Named Entity Recognition},
author = {Sungjoo Byun and Jiseung Hong and Sumin Park and Dongjun Jang and Jean Seo and Minseok Kim and Chaeyoung Oh and Hyopil Shin},
journal= {arXiv preprint arXiv:2403.16158},
year = {2024}
}