中文

面向口腔癌病灶的多类视觉识别的数据增强多模态特征融合

计算机视觉与模式识别 2026-01-06 v3

摘要

口腔癌常在晚期诊断,因为其类似于其他病灶。现有的计算机辅助诊断研究使用深度学习取得了进展;然而,大多数方法受限于小规模、不平衡的数据集以及对单一模态特征的依赖,这限制了在现实临床环境中的模型泛化。为克服这些限制,本研究提出了一种新型数据增强驱动的多模态特征融合框架,集成于一个(视觉识别)VR 辅助口腔癌识别系统。该方法结合了大规模数据中心增强与临床和图像表示的融合,以增强模型鲁棒性并减少诊断模糊性。使用分层训练管道和 EfficientNetV2 B1 主干网络,该系统提高了特征多样性,缓解了不平衡,并加强了所学的多模态嵌入。实验评估显示,所提出的框架在 2 类上实现了 82.57% 的总体准确率,在 3 类上实现了 65.13% 的准确率,在 4 类上实现了 54.97% 的准确率,超过了传统单流 CNN 模型。这些结果凸显了结合战略数据增强和多模态特征融合用于可靠早期口腔癌病灶识别的有效性,并为基于沉浸式 VR 的临床决策支持工具奠定了基础。

关键词

引用

@article{arxiv.2511.21582,
  title  = {Data-Augmented Multimodal Feature Fusion for Multiclass Visual Recognition of Oral Cancer Lesions},
  author = {Joy Naoum and Revana Salama and Ali Hamdi},
  journal= {arXiv preprint arXiv:2511.21582},
  year   = {2026}
}