从Reddit平台策展与提取药物相关实体
计算与语言
2026-05-27 v1
摘要
医生主要从临床用药过量案例中了解非法药物,这限制了他们对真实世界用药情况的理解。与此同时,药物使用者在线分享第一手经验,提供了关于药物剂量和效果的见解。为弥合这一差距,我们引入了ReDose(REddit Drug DOSe and Effect),一个包含6,435条关于物质使用的Reddit帖子的数据集。一位经委员会认证的毒理学家主要对训练集和测试集进行了标注,而两位医学生为测试集做出了贡献,标注了DRUG、DOSE和EFFECT实体。我们使用基于BERT的模型、大型语言模型(LLM)和检索增强生成(RAG)模型对6,267个标注进行了基准测试。BiomedBERT在DRUG实体上达到了0.843的F1分数,而Llama-3 70B的表现优于GPT-4(F1 = 0.79 vs. 0.72)。EFFECT实体的提取仍然具有挑战性,GPT-4的召回率为0.41。ReDose捕捉了患者策展的叙述,以推进从社交媒体中进行医学数据提取。
引用
@article{arxiv.2605.26445,
title = {Curation and Extraction of Drug-Related Entities from Reddit Platform},
author = {Zewei Wang and Zihan Xu and Yishu Wei and Michael Chary and Yifan Peng},
journal= {arXiv preprint arXiv:2605.26445},
year = {2026}
}
备注
Accepted by IEEE International Conference on Healthcare Informatics (ICHI 2026)