学习血液生物标志物的正常表示
机器学习
2026-05-19 v1 定量方法
摘要
基于血液的生物标志物是临床诊断和治疗的基础,然而其解释在很大程度上依赖于固定的群体参考区间,这些区间忽略了稳定的患者个体内变异性。因此,基于群体的解释可能会掩盖偏离个体基线的有意义的偏差,从而导致疾病检测延迟。为了解决这个问题,人们越来越多地尝试利用个体检测历史来个性化血液生物标志物的解释。然而,这些方法可能会过拟合稀疏数据,导致假阳性率升高和不必要的随访增加,并且还可能在不知情的情况下包含未识别或亚临床疾病。在这里,我们利用来自北美、中东和东亚超过 160 万个体的近 20 亿次纵向实验室测量数据,表明虽然实验室值具有高度的个体性,但纯个性化区间经常过拟合,将高达 68% 的测量值分类为异常,却与不良临床结果没有对应关联。然后,我们引入了 NORMA,这是一个基于条件 Transformer 的框架,通过同时以患者历史和关于“正常”变异的群体级数据为条件来生成参考区间。NORMA 生成的区间在预测结果(包括死亡率、急性肾损伤和慢性疾病)方面实现了更高的精确度。这些发现对实验医学中的过度个性化提出了警示,并表明将个体轨迹锚定于群体级先验优于单独使用任一方法。为了促进透明度,我们公开发布了模型、代码和交互式用户界面,以实现可访问的、个体化的实验室解释。
引用
@article{arxiv.2605.18701,
title = {Learning Normal Representations for Blood Biomarkers},
author = {Aashna P. Shah and Michelle M. Li and Yash Lal and Seffi Cohen and Liat F. Antwarg and Morgan Sanchez and James A. Diao and Chirag J. Patel and Ben Y. Reis and Ran D. Balicer and Noa Dagan and Arjun K. Manrai},
journal= {arXiv preprint arXiv:2605.18701},
year = {2026}
}