基于信号保真指数 (SFI) 的脑痴呆预测在异构真实数据上的校准
交换代数
2025-09-11 v1
摘要
\textbf{背景:} 在电子健康记录 (EHR) 上训练的机器学习模型常因分布性偏移在不同医疗系统间退化。一个根本但未被充分探讀的因素是诊断信号衰减:诊断质量和一致性在不同机构之间存在变异,这影响了用于训练和预测的编码可靠性。\textbf{目标:} 发展一种信号保真指数 (SFI),量化脑痴呆诊断数据在患者层面的质量,并测试 SFI-aware 校准以提升无结果标签的异构数据集上的模型性能。\textbf{方法:} 我们构建了一个模拟框架,生成 2500 个合成数据集,每个数据集包含 1000 名患者,具有基于脑痴呆风险因素的真实人口统计学、就诊记录和编码模式。SFI 由六个可解释组成部分导出:诊断特异性、时序一致性、熵、情境一致性、药物一致性和轨迹稳定性。SFI-aware 校准应用乘法调整,优化于 50 个模拟批次中。\textbf{结果:} 在最优参数 ( = 2.0) 下,SFI-aware 校准显著提升所有指标 ()。提升幅度从平衡准确率的 10.3\% 到召回率的 32.5\%,在精确率 (31.9\%) 和 F1 分数 (26.1\%) 上均有显著增长。性能接近参考标准,F1 分数和召回率在 1\% 内,平衡准确率和检出率分别提升 52.3\% 和 41.1\%。\textbf{结论:} 诊断信号衰减是模型泛化的可处理障碍。SFI-aware 校准提供了一种实用的、无标签的策略,用于在不同医疗环境中提升预测性能,特别是针对缺乏结果标签的大规模行政数据集。
引用
@article{arxiv.2509.08677,
title = {Cohen-Macaulayness of Powers of Edge Ideals of Weighted Oriented Graphs},
author = {Truong Thi Hien and Jiaxin Li and Tran Nam Trung and Guangjun Zhu},
journal= {arXiv preprint arXiv:2509.08677},
year = {2025}
}