中文

机器学习不良事件预测中涉及时间轴的数据划分策略研究

机器学习 2022-10-25 v2 定量方法

摘要

不良事件是药物开发中的严重问题,许多使用机器学习的预测方法已被开发。随机划分交叉验证是机器学习中模型构建与评估的事实标准,但在不良事件预测中需谨慎,因为该方法与真实世界情形不匹配。利用时间轴的时间划分被认为适合真实世界预测。然而,由于可比研究的缺乏,使用时间划分与随机划分所获模型性能的差异尚不清楚。为理解这些差异,我们使用九类化合物信息作为输入、八种不良事件作为目标、六种机器学习算法,比较了时间划分与随机划分的模型性能。对于八种目标中的六种,随机划分显示出比时间划分更高的曲线下面积值。时间划分的训练与测试数据集的化学空间相似,表明适用性域概念不足以解释由划分产生的差异。对于蛋白相互作用,曲线下面积差异小于其他数据集。后续详细分析暗示在时间划分中使用基于知识的信息存在混杂风险。这些发现表明理解不良事件预测中时间划分与随机划分差异的重要性,并强烈建议在实际不良事件预测中需恰当使用划分策略并解释结果。我们提供了本研究所用的分析代码与数据集(https://github.com/mizuno-group/AE_prediction)。

关键词

引用

@article{arxiv.2204.08682,
  title  = {Investigation of a Data Split Strategy Involving the Time Axis in Adverse Event Prediction Using Machine Learning},
  author = {Katsuhisa Morita and Tadahaya Mizuno and Hiroyuki Kusuhara},
  journal= {arXiv preprint arXiv:2204.08682},
  year   = {2022}
}

备注

20 pages, 4 figures