中文

从预测到实践:血糖预测的任务感知评估框架

机器学习 2026-05-04 v1

摘要

临床时间序列预测日益受到关注,用于决策支持,但标准的聚合指标可能掩盖模型是否真正满足其服务任务。 在安全关键场景中,低的平均误差可能伴随在最关键的高风险情境下的危险性失效。 我们构建了基于两项下游应用的血糖预测任务感知评估框架:低血糖早期预警和胰岛素剂量决策支持。 对于早期预警,我们使用来自三个临床队列的真实数据,通过事件级召回率和每患者日误报数评估,这些指标反映的是操作报警负担,而非整体准确性。 我们展示,表面上看在完全测试集上召回率超过0.9的模型,在胰岛素负荷升高且漏报后果最严重的餐后剂量后时段可能效果恶化。 标准的预测评估方法并未测试模型是否能推理动作的影响,这是支持胰岛素剂量决策的要求。 因此,我们采用FDA认可的UVA/Padova模拟器,构建第二个干预性研究,评估预测模型是否能预测 alterations to insulin plans 对血糖反应的影响,在配对的事实/反事实情境中表现如何。 我们发现,在真实数据预测中表现良好的模型,往往无法预测干预作用的方向、幅度或排序,进而在以临床为导向的成本下选择差坏的胰岛素剂量。 两部分研究共同揭示了预测准确性与任务相关实用性之间的持续性差距。 我们发布了基准数据集、用于公共队列的标准化预处理管道,以及模拟器基的干预性数据集作为可复现的工具套件。

关键词

引用

@article{arxiv.2605.00645,
  title  = {From Prediction to Practice: A Task-Aware Evaluation Framework for Blood Glucose Forecasting},
  author = {Alireza Namazi and Heman Shakeri},
  journal= {arXiv preprint arXiv:2605.00645},
  year   = {2026}
}