基于大语言模型识别生物医学文献中的证据导向性行为 nudges
机器学习
2026-02-12 v1
摘要
我们提出了一个可扩展、由 AI 驱动的系统,用于从非结构化生物医学文献中识别和提取证据导向性行为 nudges。nudge 是一种微妙的、非强制性的干预方式,通过不限制选择的方式影响行为,在提高药物依从性等健康结果方面显示出显著影响。然而,从 800 万篇以上 PubMed 文章中识别这些干预措施是一个瓶颈。我们的系统采用新型多阶段管道:首先,通过关键词、TF-IDF、余弦相似度以及“nudge-term bonus”进行混合过滤,将语料库缩减至约 81,000 篇候选文献。其次,我们使用 OpenScholar(量化版 LLaMA 3.1 8B)对论文进行分类和结构化字段提取,包括 nudge 类型和目标行为,单次完成,经 JSON 模式验证。我们在 N=197 的标注测试集上评估了四种配置。最佳配置(Title/Abstract/Intro)实现了 67.0% 的 F1 分数和 72.0% 的召回率,适合发现。采用自洽性(7 次随机化传递)的高精度变体实现了 100% 精确率与 12% 召回率,展示了面向高信任场景的可调节权衡。该系统正在集成至 Agile Nudge+平台,以将 LLM 生成的干预措施置于同行评议证据基础之上。本工作展示了可解释、领域特定的检索管道,用于证据综合与个性化医疗护理。
引用
@article{arxiv.2602.10345,
title = {Identifying Evidence-Based Nudges in Biomedical Literature with Large Language Models},
author = {Jaydeep Chauhan and Mark Seidman and Pezhman Raeisian Parvari and Zhi Zheng and Zina Ben-Miled and Cristina Barboi and Andrew Gonzalez and Malaz Boustani},
journal= {arXiv preprint arXiv:2602.10345},
year = {2026}
}