中文

基于眼动分析的混合 Vision Transformer-Mamba 框架用于自闭症诊断

计算机视觉与模式识别 2025-06-10 v1

摘要

准确诊断自闭症谱系障碍 (ASD) 对早期干预至关重要。本研究提出一种混合深度学习框架,将 Vision Transformer (ViT) 和 Vision Mamba 组合用于基于眼动数据的 ASD 检测。该模型使用基于注意力的融合机制整合视觉、语音和面部线索,捕获空间和时间动态。不同于传统基于手工特征的方法,它应用最新的深度学习和可解释人工智能技术以提高诊断准确性和透明度。我们在 Saliency4ASD 数据集上测试了所提出的 ViT-Mamba 模型,结果显示其优于现有方法,实现 0.96 的准确率、0.95 的 F1 分数、0.97 的灵敏度和 0.94 的特异度。这些发现表明,该模型在资源受限或偏远临床环境中尤其适合可扩展、可解释的 ASD 筛查,尤其是在专家诊断资源有限的地区具有重要意义。

关键词

引用

@article{arxiv.2506.06886,
  title  = {Hybrid Vision Transformer-Mamba Framework for Autism Diagnosis via Eye-Tracking Analysis},
  author = {Wafaa Kasri and Yassine Himeur and Abigail Copiaco and Wathiq Mansoor and Ammar Albanna and Valsamma Eapen},
  journal= {arXiv preprint arXiv:2506.06886},
  year   = {2025}
}

备注

7 pages, 4 figures and 2 tables