比例律:AI性能与输入样本之间通用关系的数学描述
机器学习
2024-11-05 v1 人工智能
摘要
基于机器学习和深度学习的人工智能已在蛋白质结构预测和气候建模等各个领域取得了显著进展。然而,一个核心挑战仍然存在:AI的'黑箱'性质,其中输入与输出之间的精确定量关系往往缺失。在这里,通过分析323个用于预测人类必需蛋白质的AI模型,我们发现了一条比例律,表明模型性能与少数类与多数类样本之比可以通过两个简洁的方程紧密关联。此外,我们从数学上证明了AI模型在平衡数据集上能够达到最优性能。更重要的是,我们接下来探索了这一发现是否能进一步指导我们提升AI模型的性能。因此,我们将不平衡数据集划分为若干平衡子集来训练基分类器,然后应用基于Bagging的集成学习策略来组合这些基模型。结果表明,方程引导的策略显著提升了模型性能,分别提高了4.06%和5.28%,优于传统的数据集平衡技术。最后,我们使用不同类型的分类器和10个额外的多样化二分类任务验证了这些方程的广泛适用性和泛化能力。总之,本研究揭示了两条精确关联AI输入与输出的方程,这可能有助于揭开AI神秘'黑箱'的面纱。
引用
@article{arxiv.2411.00913,
title = {Ratio law: mathematical descriptions for a universal relationship between AI performance and input samples},
author = {Boming Kang and Qinghua Cui},
journal= {arXiv preprint arXiv:2411.00913},
year = {2024}
}
备注
29 pages, 5 figures, 4 Tables