使用神经网络对社交媒体数据中的患者声音进行分类:不同数据源和治疗领域下 AI 模型的比较
计算与语言
2023-12-08 v1 人工智能
机器学习
摘要
医疗保健专业人员和医疗保健社区成员必须能够访问并轻松理解真实世界中的患者体验,以便提高护理标准并推动个性化药物治疗。社交媒体平台和留言板被认为是患者体验信息的合适来源,因为观察到患者在网上讨论和交流知识、寻找并提供支持。本文测试了这样一个假设:由于不同治疗领域和/或数据源中个体谈论自身经历的固有差异,并非所有在线患者体验信息都能以相同方式处理和收集。我们使用语言学分析来理解并识别不同数据集之间、患者语言之间、数据源(Reddit、SocialGist)和治疗领域(心血管、肿瘤、免疫、神经)之间的相似性。我们检测到同一治疗领域的患者在不同数据源中使用的共同词汇,但免疫领域的患者除外,他们在两个数据源之间使用独特的词汇,且与所有其他数据集相比亦然。我们将语言学上相似的数据集结合起来训练分类器(CNN、transformer),以准确识别社交媒体上的患者体验帖子,我们将此任务称为患者声音分类。心血管和神经领域的 transformer 分类器在 Reddit 数据源的各项比较中表现最佳,分别取得了 0.865 和 1.0 的 F1 分数。总体表现最佳的分类器是在为本次实验收集的所有数据上训练的 transformer 分类器,在所有特定于治疗领域和数据源的测试数据集上取得了介于 0.863 至 0.995 之间的 F1 分数。
引用
@article{arxiv.2312.03747,
title = {Classifying patient voice in social media data using neural networks: A comparison of AI models on different data sources and therapeutic domains},
author = {Giorgos Lysandrou and Roma English Owen and Vanja Popovic and Grant Le Brun and Beatrice Alex and Elizabeth A. L. Fairley},
journal= {arXiv preprint arXiv:2312.03747},
year = {2023}
}
备注
14 pages, 1 figure, 7 tables