分布外检测学习理论如何增强Transformer:可学习性与可靠性
机器学习
2026-01-30 v6 概率论
摘要
Transformer在自然语言处理和计算机视觉任务中表现出色。然而,它们在泛化到分布外(OOD)数据集(即分布与训练时所见数据不同的数据)方面仍面临挑战。OOD检测旨在区分异常值,同时保持分布内(ID)数据的性能。本文介绍了Transformer的OOD检测概率近似正确(PAC)理论,该理论为Transformer的OOD检测可学习性建立了数据分布和模型配置的条件。它表明,在数据充足的条件下,异常值可以被准确地表示和区分。理论含义突显了理论原理与实际训练范式之间的权衡。通过考察这种权衡,我们自然地推导出利用辅助异常值来增强OOD检测的原理。我们的理论表明,通过在损失函数中惩罚异常值的错误分类并策略性地生成软合成异常值,可以稳健地增强Transformer网络的可靠性。这种方法产生了一种新颖的算法,该算法确保了可学习性,并细化了内点和外点之间的决策边界。在实践中,该算法在各种数据格式上始终达到最先进的性能。
引用
@article{arxiv.2406.12915,
title = {How Out-of-Distribution Detection Learning Theory Enhances Transformer: Learnability and Reliability},
author = {Yijin Zhou and Yutang Ge and Wenyuan Xie and Linqian Zeng and Xiaowen Dong and Yuguang Wang},
journal= {arXiv preprint arXiv:2406.12915},
year = {2026}
}