TwinWeaver: 基于LLM的全癌症数字孪生基础模型框架
机器学习
2026-02-11 v2
摘要
精准肿瘤学需要预测临床事件和轨迹,然而对稀疏、多模态的临床时间序列进行建模仍然是一个关键挑战。我们介绍了TwinWeaver,一个开源框架,它将纵向患者病史序列化为文本,从而能够使用大型语言模型进行统一的事件预测和预测,并利用它在93,054名患者(涵盖20种癌症类型)上构建了Genie数字孪生(GDT)。在基准测试中,GDT显著降低了预测误差,实现了0.87的中位平均绝对尺度误差(MASE),而最强的时间序列基线为0.97(p<0.001)。此外,GDT改善了风险分层,在生存、进展和治疗转换任务上实现了0.703的平均一致性指数(C-index),超过了0.662的最佳基线。GDT还能泛化到分布外的临床试验,在零样本情况下匹配训练过的基线,并通过微调超越它们,实现了0.75-0.88的中位MASE,并在事件预测中以0.672对0.648的平均C-index优于最强基线。最后,TwinWeaver支持一个可解释的临床推理扩展,为纵向临床建模提供了一个可扩展且透明的基础。
引用
@article{arxiv.2601.20906,
title = {TwinWeaver: An LLM-Based Foundation Model Framework for Pan-Cancer Digital Twins},
author = {Nikita Makarov and Maria Bordukova and Lena Voith von Voithenberg and Estrella Pivel-Villanueva and Sabrina Mielke and Jonathan Wickes and Hanchen Wang and Mingyu Derek Ma and Keunwoo Choi and Kyunghyun Cho and Stephen Ra and Raul Rodriguez-Esteban and Fabian Schmich and Michael Menden},
journal= {arXiv preprint arXiv:2601.20906},
year = {2026}
}