中文

基于 PubMedBERT 并结合数据增强策略的推文药物提及检测分类器

计算与语言 2021-12-07 v1 机器学习

摘要

作为一个主要的社交媒体平台,Twitter 每日发布大量用户生成文本(推文)。挖掘此类数据可用于解决通过其他手段不可行的社会、公共卫生和应急管理问题。许多文本挖掘流程中的一个关键步骤是命名实体识别(NER),其对推文数据提出了一些特殊挑战,包括非标准表达、极度不平衡的类别以及缺乏上下文信息等。BioCreative 挑战 VII(BC7)的 track 3 旨在评估检测推文中药物提及的方法。本文报告我们在 BC7 track 3 上的工作,其中我们探索了一个基于 PubMedBERT 的分类器,并使用多种数据增强方法的组合进行训练。我们的方法取得了 0.762 的 F1 分数,显著高于所有提交结果的平均值(0.696)。

关键词

引用

@article{arxiv.2112.02998,
  title  = {A PubMedBERT-based Classifier with Data Augmentation Strategy for Detecting Medication Mentions in Tweets},
  author = {Qing Han and Shubo Tian and Jinfeng Zhang},
  journal= {arXiv preprint arXiv:2112.02998},
  year   = {2021}
}