中文

使用易出错膳食摄入数据进行神经网络技术预测建模的挑战

机器学习 2025-02-12 v1 应用统计

摘要

膳食摄入数据常被用于探索饮食与健康的关系。然而,这些数据常受测量误差影响,扭曲了真实关系。除测量误差外,不同膳食成分之间可能存在复杂的协同甚至拮抗相互作用,使饮食与健康结局之间的关系复杂化。需要灵活的模型来捕捉这些复杂相互作用引入的细微差异。这种复杂性使饮食—健康关系研究成为机器学习技术尤其是神经网络的一个有吸引力的应用候选。神经网络是能够捕捉高度复杂非线性关系的计算模型,只要有充足数据即可。尽管这些模型已应用于诸多领域,测量误差对预测建模性能的影响尚未被系统研究。然而,膳食摄入数据通常通过自我报告方法收集,易产生大量测量误差。在本工作中,我们展示了测量误差削弱神经网络性能的方式,并说明在存在误差时利用这些模型所需的谨慎。我们展示了样本量与重复测量对模型性能的作用,指出研究向可加性变换的动机,并说明防止模型过拟合所需的谨慎。尽管神经网络在各领域的过往表现使其成为考察饮食—健康关系的诱人候选,我们的工作表明,与更传统的统计流程相比,要在应用这些技术时观察到预测性能的提升,还需大量谨慎与进一步的方法学发展。

关键词

引用

@article{arxiv.2311.09338,
  title  = {Challenges for Predictive Modeling with Neural Network Techniques using Error-Prone Dietary Intake Data},
  author = {Dylan Spicker and Amir Nazemi and Joy Hutchinson and Paul Fieguth and Sharon I. Kirkpatrick and Michael Wallace and Kevin W. Dodd},
  journal= {arXiv preprint arXiv:2311.09338},
  year   = {2025}
}