中文

用还是不用 Softmax:将主动学习应用于 Transformer 模型时的关键问题

机器学习 2025-03-13 v1 人工智能 计算与语言 数据库

摘要

尽管基于 Transformer 的语言模型在几乎所有自然语言处理应用中都取得了最先进的结果,但其微调仍需要大量标注数据才能发挥作用。一种众所周知的减少标注数据集人工投入的技术是 \textit{主动学习}(AL):一种仅标注最少量样本的迭代过程。AL 策略需要访问模型预测的量化置信度度量。一个常见选择是最后一层使用 softmax 激活函数。由于 softmax 函数提供具有误导性的概率,本文在七个数据集上比较了八种替代方案。我们近乎矛盾发现是,大多数方法过于擅长识别真正最不确定的样本(离群点),而因此仅标注离群点会导致更差的性能。作为一种启发式方法,我们提议系统性地忽略样本,这使得多种方法相较 softmax 函数取得了改进。

关键词

引用

@article{arxiv.2210.03005,
  title  = {To Softmax, or not to Softmax: that is the question when applying Active Learning for Transformer Models},
  author = {Julius Gonsior and Christian Falkenberg and Silvio Magino and Anja Reusch and Maik Thiele and Wolfgang Lehner},
  journal= {arXiv preprint arXiv:2210.03005},
  year   = {2025}
}