中文

基于层次随机注意力的Transformer不确定性估计

计算与语言 2021-12-28 v1 人工智能

摘要

Transformer在自然语言处理(NLP)的广泛任务中处于最先进水平,并已应用于许多实际产品。理解Transformer模型预测的可靠性和确定性对于构建可信的机器学习应用(例如医学诊断)至关重要。尽管已提出许多Transformer扩展,但对Transformer模型不确定性估计的研究仍显不足。在本工作中,我们提出一种新方法,使Transformer具备不确定性估计能力,同时保持原有预测性能。这是通过学习一种分别关注数值和一组可学习质心的层次随机自注意力来实现的。随后使用Gumbel-Softmax技巧以采样质心的混合形成新的注意力头。我们从理论上证明,从Gumbel分布采样对自注意力的近似具有上界。我们在两个文本分类任务上,使用域内(ID)和域外(OOD)数据集对模型进行了实证评估。实验结果表明,我们的方法:(1)在预测性能与不确定性的权衡上优于对比方法;(2)在ID数据集上展现出极具竞争力(多数情况下更优)的预测性能;(3)在OOD数据集的不确定性估计上与Monte Carlo dropout和集成方法相当。

关键词

引用

@article{arxiv.2112.13776,
  title  = {Transformer Uncertainty Estimation with Hierarchical Stochastic Attention},
  author = {Jiahuan Pei and Cheng Wang and György Szarvas},
  journal= {arXiv preprint arXiv:2112.13776},
  year   = {2021}
}

备注

AAAI 2022