基于多模态视觉与语义信息的注意力双编码器框架用于自动阻塞性睡眠呼吸暂停综合征诊断
计算机视觉与模式识别
2024-12-30 v1 机器学习
摘要
阻塞性睡眠呼吸暂停综合征(OSAHS)是由上呼吸阻塞引起的常见睡眠障碍,导致氧气缺乏和睡眠 disruption。传统诊断方法依赖多导睡眠监测(PSG),该方法成本高、耗时且不适患者。现有基于面部图像分析的深度学习方法由于面部特征捕获不足和样本量有限,诊断准确性较差。为此,我们提出一种集成视觉与语言输入的多模态双编码器模型,用于自动化OSAHS诊断。该模型采用randomOverSampler进行数据平衡,利用注意力网格提取关键面部特征,将生理数据转换为有意义的文本。通过跨注意力机制融合图像与文本数据以实现更好的特征提取,并采用有序回归损失确保学习的稳定性。我们的方法提高了诊断效率与准确性,在四分类严重程度分类任务中实现了91.3%的Top-1准确率,展示了当前最先进的性能。代码将在接受后公开。
关键词
引用
@article{arxiv.2412.18919,
title = {An Attentive Dual-Encoder Framework Leveraging Multimodal Visual and Semantic Information for Automatic OSAHS Diagnosis},
author = {Yingchen Wei and Xihe Qiu and Xiaoyu Tan and Jingjing Huang and Wei Chu and Yinghui Xu and Yuan Qi},
journal= {arXiv preprint arXiv:2412.18919},
year = {2024}
}
备注
5 pages, 2 figures, Published as a conference paper at ICASSP 2025