中文

基于 Gevrey 类为 Transformer 提出 OOD 鲁棒性理论框架

机器学习 2025-06-02 v2

摘要

我们研究了 Transformer 语言模型在语义上离群分布 (out-of-distribution, OOD) 偏移下的鲁棒性,其中训练和测试数据位于互不相交的潜在空间中。运用 Wasserstein-1 距离和 Gevrey 类光滑性,我们推导了关于预测误差的亚指数上界。我们的理论框架解释了光滑性如何支配分布漂移下的泛化。我们通过在算术和链路思考任务中进行受控实验(包括潜在置换和缩放),验证了这些发现。结果表明,经验性退化与我们的上界一致,凸显了 Transformer OOD 泛化背后的几何与函数原理。

关键词

引用

@article{arxiv.2504.12991,
  title  = {A Theoretical Framework for OOD Robustness in Transformers using Gevrey Classes},
  author = {Yu Wang and Fu-Chieh Chang and Pei-Yuan Wu},
  journal= {arXiv preprint arXiv:2504.12991},
  year   = {2025}
}