通过蒙特卡罗抽样探讨变压器模型的Dropout鲁棒性与认知轮廓
机器学习
2026-03-19 v1 人工智能
摘要
变压器基语言模型在推理任务中广泛应用,但其在推理时随机性下的行为仍未得到充分探索。虽然Dropout在训练中常见,但其通过蒙特卡罗抽样的推理时效应在不同架构之间缺乏系统评估,限制了对不确定性感知应用中模型可靠性的理解。本文使用MC Dropout对19种变压器模型进行分析,每个样本进行100次随机前向传播。将Dropout鲁棒性定义为在随机推理下保持高准确率和稳定预测的能力,以每次运行的准确率标准差进行衡量。构建认知分解框架,将性能分解为记忆和推理组成部分。实验覆盖五种Dropout配置,在1000个样本上进行95次独立评估。结果显示架构差异显著。小型模型表现出完美的预测稳定性,而中等规模模型则表现出显著的波动性。中等规模模型实现最佳整体性能;大型模型在记忆任务中表现突出。关键在于,53%的模型在基线MC Dropout下遭遇严重准确率下降,其中任务专用模型可损失最高24个百分点,表明这些架构在不确定性量化方面不适用。出现非对称效应:高Dropout使记忆准确率下降27个百分点,而推理仅下降1个百分点,表明记忆任务依赖稳定的表示,而Dropout会破坏这些表示。84%的模型表现出记忆偏向。本文首次提供变压器模型的全面MC Dropout基准,揭示Dropout鲁棒性与规模无关且与架构相关。认知分解框架为不确定性感知应用中的模型选择提供可操作指导。
引用
@article{arxiv.2603.17811,
title = {Dropout Robustness and Cognitive Profiling of Transformer Models via Stochastic Inference},
author = {Antônio Junior Alves Caiado and Michael Hahsler},
journal= {arXiv preprint arXiv:2603.17811},
year = {2026}
}