中文

ChainzRule: 跨表格、自然语言处理和视觉任务的高样本效率、鲁棒深度学习

机器学习 2026-05-26 v1

摘要

企业领域的生产深度学习系统在学术基准测试通常忽略的约束条件下运行:标注数据昂贵、推理预算紧张,且无法解释其行为的模型难以信任和维护。我们提出了ChainzRule (CR),一种神经架构,它用可学习的多项式层替换典型的激活函数,这些多项式层由微分正则化(DREG)控制,这是一种在前向传播过程中以标准推理成本分析计算的逐层雅可比惩罚。核心主张是,约束中间导数迫使网络趋向低频、结构稳定的表示,同时减少对标注数据量的依赖,提高对分布偏移的鲁棒性,并为模型行为提供一个可测量的、基于梯度的处理手段。在五个领域进行评估,CR在Pima糖尿病数据集上达到85.71%±2.01%85.71\% \pm 2.01\%(统计上优于SVM和XGBoost),在使用冻结编码器的SST-5情感分类上达到46.20%±0.37%46.20\% \pm 0.37\%(优于使用其约5%训练数据的RNTN),在使用微调BERT骨干的SST-5上达到55.79%55.79\%(对比BERT-base线性头的54.9%54.9\%),在Yelp Full有序回归上以320万参数达到70.17%70.17\%(对比10模型平均的66.35%66.35\%),在CIFAR-10-C上平均损坏准确率提升+2.32%+2.32\%。所有报告的pp值结果在Bonferroni校正后均低于α=0.05\alpha = 0.05阈值。CR在所有数据比例下,其梯度尾部比率τ\tau(p99/均值)维持在1.011.01--1.021.02,而所有典型激活函数基线为1.071.07--1.091.09,我们提出这一结构不变性作为样本效率的机制驱动因素和部署时模型可靠性的代理指标。

关键词

引用

@article{arxiv.2605.24340,
  title  = {ChainzRule: Sample-Efficient, Robust Deep Learning Across Tabular, NLP, and Vision Tasks},
  author = {Rowan Martnishn},
  journal= {arXiv preprint arXiv:2605.24340},
  year   = {2026}
}