中文

我们可以通过在模拟数据上预训练来提高治疗结果预测吗?

机器学习 2026-01-13 v1

摘要

在个性化医疗的背景下,机器学习算法的应用正在迅速增长。这些算法需要大量信息,这些信息可以通过有效利用之前收集的数据来获取。已提出开放数据和合成化技术的使用来解决这一问题。在本文中,我们提出并评估了另一种方法,该方法使用基于文献中总结统计信息的模拟数据进行预训练,然后在真实数据集上进行微调。我们将新的方法与仅在真实数据上训练的随机森林进行比较。采用 100 次蒙特卡洛交叉验证(MCCV)框架来调查结果的显著性和稳定性。由于第一次研究结果令人 inconclusive,我们进行了第二次研究,方法得以改进(即系统信息提取和不同的预测结果)。在研究 1 中,一些预训练随机森林在描述性上超过标准随机森林。然而,这一改进并不显著(t(99) = 0.89, p = 0.19)。与预期相反,在研究 2 中,仅使用真实数据训练的随机森林超过了预训练随机森林。我们随后讨论了挑战问题,例如信息丰富的出版物的稀缺情况,并对未来研究提出建议。

关键词

引用

@article{arxiv.2601.06159,
  title  = {Can we Improve Prediction of Psychotherapy Outcomes Through Pretraining With Simulated Data?},
  author = {Niklas Jacobs and Manuel C. Voelkle and Norbert Kathmann and Kevin Hilbert},
  journal= {arXiv preprint arXiv:2601.06159},
  year   = {2026}
}