中文

基于小数据集的口腔癌鲁棒分类

计算机视觉与模式识别 2025-10-03 v1 机器学习

摘要

口腔癌是全球最常见的癌症之一,在缺乏 adequate 医疗资源的地区死亡率尤为高. 及早诊断对于降低死亡率至关重要;然而,由于口腔健康项目不足、基础设施薄弱以及医务人员短缺等挑战仍然存在. 传统的深度学习模型虽前景光明,但往往依赖点估计,导致过度自信且可靠性降低. 严重的是,这些模型需要大数据集来缓解过拟合并确保可泛性,而在训练数据有限的环境中这几乎不可能. 为此,我们提出一种混合模型,将卷积神经网络(CNN)与贝叶斯深度学习结合,用于小数据集的口腔癌分类. 该方法采用变分推断来通过不确定性量化来增强可靠性. 该模型在使用智能手机拍摄的彩色图像进行训练后,在三个不同的测试数据集上进行评估. 所提出的方法在测试数据集上的准确率达到 94%,与传统 CNN 性能相当. 值得注意的是,对于真实世界的摄影图像数据,尽管存在局限性和与训练数据集不同的变化,所提出的方法在多样化数据集上展现出更好的可泛性,准确率达到 88%,而传统 CNN 仅为 72.94%,即使数据集较小亦如此. 置信度分析显示,该模型对正确分类的样本表现出低不确定性(高置信度),而对误分类的样本表现出高不确定性(低置信度). 这些结果凸显了贝叶斯推断在数据稀缺环境中通过提高模型可靠性和可泛性来增强早期口腔癌诊断的有效性.

关键词

引用

@article{arxiv.2510.01547,
  title  = {Robust Classification of Oral Cancer with Limited Training Data},
  author = {Akshay Bhagwan Sonawane and Lena D. Swamikannan and Lakshman Tamil},
  journal= {arXiv preprint arXiv:2510.01547},
  year   = {2025}
}