中文

生成用于基于人工智能的疾病轨迹预测与药物开发数字孪生的合成多维分子-介质时间序列数据:若干考量

人工智能 2023-03-17 v1

摘要

合成数据的使用被公认为基于神经网络的 AI 系统开发中的关键步骤。尽管其他领域生成合成数据的方法在某些主要关乎图像处理的生物医学 AI 系统中发挥作用,但在需要了解系统运作机制的 AI 任务的时间序列数据生成方面存在关键空白。这一点在生成合成多维分子时间序列数据(SMMTSD)的能力上最为突出;这类数据支撑着用于预测各种疾病的生物标志物和介质特征的研究,并且是药物开发流程的基本组成部分。我们认为,统计和以数据为中心的机器学习(ML)生成此类合成数据的方法之所以不足,是由于多种因素的共同作用:维度灾难导致的持续性数据稀疏、中心极限定理的不适用性,以及因果层次定理所施加的限制。作为替代,我们提出了使用复杂的多尺度基于机制的仿真模型的理由,这些模型被构建和操作用于应对认知不完备性,并需依据最大熵原理提供最大扩展性。这些流程生成的 SMMTD 最小化了与神经网络 AI 系统相关的已知缺陷,即过拟合和缺乏泛化能力。生成考虑了多维时间序列数据已识别因素的合成数据,是基于介质-生物标志物的 AI 预测系统以及通过药物开发数字孪生等系统进行的治疗控制开发与优化的必备能力。

关键词

引用

@article{arxiv.2303.09056,
  title  = {Generating synthetic multi-dimensional molecular-mediator time series data for artificial intelligence-based disease trajectory forecasting and drug development digital twins: Considerations},
  author = {Gary An and Chase Cockrell},
  journal= {arXiv preprint arXiv:2303.09056},
  year   = {2023}
}

备注

16 pages, 2 Figures