想在推文中识别、抽取与规范化药物不良反应?用RoBERTa
计算与语言
2020-06-30 v1
摘要
本文介绍我们针对2020年健康社交媒体挖掘 (SMM4H) 共享任务中任务2与任务3的方法。任务2中,需区分药物不良反应 (ADR) 推文与非ADR推文,视为二分类。任务3涉及抽取ADR提及并将其映射至MedDRA代码。抽取ADR提及视为序列标注,规范化ADR提及视为多类分类。我们的系统基于预训练语言模型RoBERTa,其取得:a) 任务2中F1-score为58%,高于平均分12%;b) 任务3中ADR抽取的松弛F1-score为70.1%,高于平均分13.7%,以及任务3中ADR抽取+规范化的松弛F1-score为35%,高于平均分5.8%。总体而言,我们的模型在两任务中均取得有前景的结果,较平均分显著提升。
引用
@article{arxiv.2006.16146,
title = {Want to Identify, Extract and Normalize Adverse Drug Reactions in Tweets? Use RoBERTa},
author = {Katikapalli Subramanyam Kalyan and S. Sangeetha},
journal= {arXiv preprint arXiv:2006.16146},
year = {2020}
}
备注
4 pages