来自 Reddit 的阿片类命名实体识别(ONER-2025)
计算与语言
2025-08-13 v4 人工智能
摘要
阿片类过量死亡疫情仍是美国等国家面临的严重公共卫生危机,导致显著的死亡率和社会经济成本。社交媒体平台如 Reddit 提供了大量非结构化数据,可为洞察公众对阿片使用态度、讨论和经历提供宝贵信息。本研究利用自然语言处理(NLP),具体应用阿片类命名实体识别(ONER-2025),从这些平台提取可操作信息。我们的研究作出四项关键贡献:第一,我们创建了一个独特的、从 Reddit 上手动标注的数据集,用户在该平台上分享其阿片使用经历的不同给药方式。该数据集包含 331,285 个标记,并包括八个主要的阿片实体类别。第二,我们详细描述了标注过程和指南,同时讨论了标记 ONER-2025 数据集的挑战。第三,我们分析了包括俚语、歧义、碎片化句子和情感化语言在内的阿片讨论中的关键语言挑战。第四,我们提出了一个实时监控系统,用于处理来自社交媒体、医疗记录和急救服务的流式数据,以识别过量死亡事件。我们在 11 项实验中采用 5 折交叉验证,系统整合了机器学习、深度学习和基于 Transformer 的语言模型,结合先进的上下文嵌入以增强理解。我们的基于 Transformer 的模型(bert-base-NER 和 roberta-base)实现了 97% 的准确率和 F1 分数,显著优于基线模型 10.23%(RF=0.88)。
引用
@article{arxiv.2504.00027,
title = {Opioid Named Entity Recognition (ONER-2025) from Reddit},
author = {Muhammad Ahmad and Rita Orji and Fida Ullah and Ildar Batyrshin and Grigori Sidorov},
journal= {arXiv preprint arXiv:2504.00027},
year = {2025}
}