Learning study similarity to investigate heterogeneity in meta-analysis using LLMs and triplet loss
统计方法学
2026-05-29 v1
摘要
观察性研究的 meta-分析常显示出显著的研究间异质性,限制了 pooled 估计的可解释性。meta-regression 可用于探索异质性,但常常缺乏处理多个效应修饰变量的功效。我们提出一种新框架,将大语言模型(LLMs)与深度度量学习集成,用于在 meta-分析前推断研究水平的相似性。研究水平的临床和方法特征由 LLM 处理以生成研究三元组(锚点、相似、 不相似)。这些三元组通过将每个研究作为锚点并与另一对研究比较来构建,以识别在每个实例中最接近锚点的研究。然后,使用三元损失训练嵌入模型;一种深度学习方法,在该方法中,临床和方法上相似的研究被聚类在一起。我们将该框架应用于58项比较早产儿和足月儿儿童认知结果的观察性研究的 meta-分析数据集。随后,我们在识别出的研究集群中拟合 meta-分析模型,并将结果与整体分析结果进行比较。结果表明,存在三个集群,其中两个保留了相当大的研究间异质性。剩余的集群包含最具同质性的研究组,显示出更极端的 pooled 效应估计值以及较窄的预测区间,与整体分析相比。该工作为通过包含研究特征的 meta-分析中的异质性探索提供了新方法。通过将研究信息转化为相似性空间,该框架识别出连贯的子组并支持在真实世界证据中实现更精确的推断。
引用
@article{arxiv.2605.29603,
title = {Learning study similarity to investigate heterogeneity in meta-analysis using LLMs and triplet loss},
author = {Kanella Panagiotopoulou and Theodoros Evrenoglou},
journal= {arXiv preprint arXiv:2605.29603},
year = {2026}
}
备注
17 pages, 4 figures