大语言模型在分布外检测上的表现如何?
计算与语言
2024-04-17 v4
摘要
分布外(OOD)检测在提升机器学习(ML)模型可靠性方面起着至关重要的作用。大语言模型(LLMs)的出现引发了 ML 领域的范式转变,展现了其在多样自然语言处理任务中的卓越能力。尽管已有研究使用 BERT、RoBERTa 和 GPT-2 等相对小规模的 Transformer 探究 OOD 检测,但规模、预训练目标与推理范式的巨大差异,使这些发现对 LLMs 的适用性存疑。本文对 LLMs 领域的 OOD 检测展开开创性实证研究,聚焦于规模从 7B 到 65B 的 LLaMA 系列。我们全面评估常用 OOD 检测器,审视其在零梯度和微调场景下的性能。值得注意的是,我们将先前的判别式分布内微调改为生成式微调,使 LLMs 的预训练目标与下游任务对齐。我们的发现揭示,简单的余弦距离 OOD 检测器展现出更优效能,优于其他 OOD 检测器。我们通过强调 LLMs 嵌入空间的各向同性本质——这与较小 BERT 族模型中的各向异性特征形成鲜明对比——为此现象提供了有趣的解释。这一新见解增进了我们对 LLMs 如何检测 OOD 数据的理解,从而提升其在动态环境中的适应性与可靠性。我们已在 \url{https://github.com/Awenbocc/LLM-OOD} 发布源代码以供其他研究者复现结果。
引用
@article{arxiv.2308.10261,
title = {How Good Are LLMs at Out-of-Distribution Detection?},
author = {Bo Liu and Liming Zhan and Zexin Lu and Yujie Feng and Lei Xue and Xiao-Ming Wu},
journal= {arXiv preprint arXiv:2308.10261},
year = {2024}
}
备注
Accepted at COLING 2024