QuaLLM-Health:从线上健康讨论中提取定量数据的 LLM 适配框架
计算与语言
2024-11-28 v1
摘要
社交媒体上的健康相关讨论(如 Reddit)提供了宝贵的洞察,但从非结构化文本中提取定量数据具有挑战性。本文提出了一个从 QuaLLM 框架适配而来的框架,称为 QuaLLM-Health,用于从关于糖肽类受体激动剂(GLP-1 受体激动剂)的 Reddit 讨论中提取临床相关的定量数据。我们于 2024 年 7 月通过 Reddit API 收集了来自五个 GLP-1 相关社区的 41 万条帖子和评论。过滤后,2059 条与癌症相关的独特条目 remain。我们开发了注释指南,用于手动提取变量,包括癌症生存率、家族癌症史、提及的癌症类型、风险感知以及与医生的讨论。两个领域专家独立对随机抽取的 100 条条目进行注释,以创建金标准数据集。随后,我们利用 OpenAI 的 GPT-4o-mini 对金标准数据集进行迭代式提示工程,构建优化后的管道,从而从大数据集中提取这些变量。优化后的 LLM 在所有变量上均实现了 0.85 以上的准确率,精确率、召回率和 F1 分数宏平均值均超过 0.90,表明性能均衡。稳定性测试显示,跨运行的匹配率达 95%,确认了一致性。将该框架应用于完整数据集后,成功高效地提取了完成下游分析所需的变量,成本不足 $3,约 1 小时即可完成。QuaLLM-Health 表明,LLM 能够有效且高效地从非结构化社交媒体内容中提取临床相关的定量数据。融合人类专业知识和迭代式提示优化可确保准确性和可靠性。这种方法论方法可以被适用于 various health 领域的大规模患者生成数据分析,为医疗研究提供宝贵的洞察。
引用
@article{arxiv.2411.17967,
title = {QuaLLM-Health: An Adaptation of an LLM-Based Framework for Quantitative Data Extraction from Online Health Discussions},
author = {Ramez Kouzy and Roxanna Attar-Olyaee and Michael K. Rooney and Comron J. Hassanzadeh and Junyi Jessy Li and Osama Mohamad},
journal= {arXiv preprint arXiv:2411.17967},
year = {2024}
}