中文

评估基于常规实验室数据的早期癌症检测可行性:针对不平衡数据集的机器学习方法评估

机器学习 2025-12-11 v2 人工智能

摘要

开发面向犬类的早期癌症检测可及筛查工具代表了兽医学中的一个重要挑战。常规实验室数据为此类工具提供了有前景的、低成本的来源,但其效用受制于单个生物标志物的非特异性以及筛查人群中严重的类别不平衡。本研究在真实世界约束下评估了使用Golden Retriever Lifetime Study(GRLS)队列进行癌症风险分类的可行性,包括对不同癌症类型的分组以及后诊断样本的纳入。进行了全面的基准评估,系统比较了126条分析管线,这些管线包括各种机器学习模型、特征选择方法和数据平衡技术。按患者水平对数据进行分区,以防止数据泄漏。最优模型是一种带有类别权重和递归特征消除的Logistic回归分类器,显示中等的排序能力(AUROC=0.815; 95% CI: 0.793-0.836),但表现出差的临床分类性能(F1得分=0.25,正预测值=0.15)。虽然实现了很高的阴性预测值(0.98),但召回率(0.79)不足以将其用作可靠的否认测试。解释性分析使用SHapley Additive exPlanations(SHAP)揭示,预测由非特异性特征如年龄和炎症/贫血标记物驱动。结论是尽管在常规实验室数据中存在可检测的癌症信号,但其过于弱且受到正常老化或其他炎症性疾病的混淆,导致其不适合从临床可靠地进行区分。这一工作为该数据模式本身的临床可行性设定了关键的性能上限,并强调在计算兽医肿瘤学中需要多模式数据源的整合才能取得实质性进展。

关键词

引用

@article{arxiv.2510.20209,
  title  = {Assessing the Feasibility of Early Cancer Detection Using Routine Laboratory Data: An Evaluation of Machine Learning Approaches on an Imbalanced Dataset},
  author = {Shumin Li},
  journal= {arXiv preprint arXiv:2510.20209},
  year   = {2025}
}