ASD-Bench:面向自闭谱系障碍的AI模型四维全面基准
机器学习
2026-05-13 v1 人工智能
摘要
自动ASD筛查工具仍受限于单一架构评估、轴向受限评估,以及近专注于成年人群,掩盖了对早期干预至关重要的年龄特定诊断模式。我们引入ASD-Bench,对ML、深度学习和 foundation model配置进行系统性tabular基准评估,横跨三个年龄群体(1-11岁儿童,12-16岁青少年,17-64岁成年人),评估四个维度:预测性能、校准、可解释性和对抗鲁棒性。应用于4068条AQ-10记录的精选v3数据集,我们的基准涵盖经典模型(XGBoost、AdaBoost、Random Forest、Logistic Regression)、神经网络(MLP)、深度tabular转换器(TabNet、TabTransformer、FT-Transformer)以及TabPFN v2。我们提出Heuristic Aggregate Penalty(HAP):一种成本敏感度量,重罚false negative,并纳入交叉验证方差以衡量部署稳定性。成年人分类实现高性能(10/17模型实现完美F1与AUC),青少年任务较困难(F1上限0.837 vs. 儿童0.915)。特征层次结构随群体变化:儿童以A9(社交动机)为主,青少年以A5(模式识别)为主,成年人表现出较平缓的重要性轮廓,符合发展中的社交掩模。准确率与校准分离:AdaBoost在成年人上实现F1=1.000但ECE=0.302,确认单一指标评估不足用于临床AI。提供了基于群体的部署建议。所有发现应解释为基于问卷派生标签的概念验证证据,而非临床验证诊断性能。
引用
@article{arxiv.2605.11091,
title = {ASD-Bench: A Four-Axis Comprehensive Benchmark of AI Models for Autism Spectrum Disorder},
author = {Shubhankit Singh and Hassan Shaikh and Kuldeep Raghuwanshi and Keshav Bulia},
journal= {arXiv preprint arXiv:2605.11091},
year = {2026}
}
备注
20 pages, 12 figures, 8 tables