将特征衰减技术应用于自然语言处理
机器学习
2026-01-06 v1 人工智能
摘要
Transformer 分类器如 BERT 能实现惊人的闭合集准确率,但在面对来自未见类别的输入时仍显脆弱——这是部署型 NLP 系统常见的情形。我们通过将计算机视觉中的特征衰减假设移植到 Transformer 上,并对其进行基准测试来探讨文本的开放集识别 (OSR)。具体而言,我们将 COSTARR 框架——原本用于计算机视觉中的分类——适配到两种较小的语言模型 (BERT (base) 和 GPT-2) 上,以对 176 个 arXiv 主题区域进行训练。除了 COSTARR 之外,我们还评估了最大软最大概率 (MSP)、MaxLogit 以及温度缩放的自由能得分,在 OOSA 和 AUOSCR 指标下进行比较。我们的结果表明:(i) COSTARR 可在无需重新训练的情况下扩展到 NLP,但相对于 MaxLogit 或 MSP 并未实现统计显著的提升;(ii) 在高类别计数的设置下,自由能得分落后于所有其他得分。该研究既凸显了将面向视觉的 OSR 思路移植到语言模型方面的潜力,也揭示了当前的局限性,指向需要更大规模的 backbone 以及面向特定任务的衰减策略的方向。
引用
@article{arxiv.2601.00965,
title = {Adapting Feature Attenuation to NLP},
author = {Tianshuo Yang and Ryan Rabinowitz and Terrance E. Boult and Jugal Kalita},
journal= {arXiv preprint arXiv:2601.00965},
year = {2026}
}