社交媒体作为传感器:利用自然语言处理分析Twitter数据中的乳腺癌药物效应
计算与语言
2024-07-30 v1 机器学习
社会与信息网络
摘要
乳腺癌是一个重大的公共卫生问题,也是女性癌症相关死亡的主要原因。尽管乳腺癌治疗取得了进展,但药物不依从性仍然是一个主要问题。由于电子健康记录通常无法捕捉可能揭示药物相关经历信息的患者报告结局,社交媒体成为增强我们对患者治疗经历理解的宝贵资源。在本文中,我们开发了基于自然语言处理(NLP)的方法,用于研究从社交媒体自动筛选的乳腺癌队列发布的信息。我们采用基于Transformer的分类器,根据用户在X(Twitter)上自我报告的信息识别乳腺癌患者/幸存者,并收集其个人资料的纵向数据。然后,我们设计了一个多层规则模型,用于构建乳腺癌治疗相关副作用词典,并检测乳腺癌患者中药物使用模式及相关副作用。我们从583,962个独立用户中获取了1,454,637条帖子,其中62,042个用户被我们的Transformer模型检测为乳腺癌成员。198名队列成员提到了乳腺癌药物,其中他莫昔芬最为常见。我们的副作用词典识别了激素和化疗的已知副作用。此外,它还发现了受试者对癌症和药物的主观感受,这可能提示副作用的临床前期或情绪困扰。该分析不仅凸显了NLP技术在非结构化社交媒体数据中识别自我报告的乳腺癌帖子、药物使用模式和治疗副作用的效用,也展示了此类临床问题上社交数据的丰富性。
引用
@article{arxiv.2403.00821,
title = {Social Media as a Sensor: Analyzing Twitter Data for Breast Cancer Medication Effects Using Natural Language Processing},
author = {Seibi Kobara and Alireza Rafiei and Masoud Nateghi and Selen Bozkurt and Rishikesan Kamaleswaran and Abeed Sarker},
journal= {arXiv preprint arXiv:2403.00821},
year = {2024}
}