提升全文文章中化学物质识别的标注一致性与实体覆盖度
计算与语言
2021-11-23 v1 信息检索
摘要
本文是我们提交至BioCreative VII Track 2挑战赛化学物质识别任务系统的技术报告。该挑战的主要特点是数据由全文文章组成,而当前数据集通常仅包含标题与摘要。为有效解决该问题,我们旨在利用多种方法提升标注一致性与实体覆盖度,例如在同一文章内对命名实体识别(NER)采用多数投票,以及将词典与神经模型相结合的混合方法用于规范化。在NLM-Chem数据集上的实验表明,我们的方法提升了模型性能,尤其在召回率方面。最终,在该挑战的官方评测中,我们的系统在NER上排名第1,显著优于基线模型及来自16个团队的80余份提交。
引用
@article{arxiv.2111.10584,
title = {Improving Tagging Consistency and Entity Coverage for Chemical Identification in Full-text Articles},
author = {Hyunjae Kim and Mujeen Sung and Wonjin Yoon and Sungjoon Park and Jaewoo Kang},
journal= {arXiv preprint arXiv:2111.10584},
year = {2021}
}
备注
BioCreative VII Challenge Evaluation Workshop