面向鲁棒语言模型的伪分布外训练
计算与语言
2022-10-18 v1
摘要
尽管预训练的大规模深度模型作为许多下游自然语言处理(NLP)任务的重要主题已受到关注,此类模型在分布外(OOD)输入上常做出不可靠的预测。因此,OOD检测是任何工业级应用中可靠机器学习模型的关键组成部分。常见方法通常假设在训练阶段可获取额外的OOD样本,然而离群分布往往事先未知。为此,我们提出一种称为POORE(POsthoc pseudo-Ood REgularization,事后伪OOD正则化)的事后框架,利用分布内(IND)数据生成伪OOD样本。通过引入新的正则化损失以分离IND与OOD数据的嵌入,模型被微调,从而在测试阶段的OOD预测任务上取得显著提升。我们在三个真实对话系统上广泛评估了我们的框架,在OOD检测上达到了新的SOTA。
引用
@article{arxiv.2210.09132,
title = {Pseudo-OOD training for robust language models},
author = {Dhanasekar Sundararaman and Nikhil Mehta and Lawrence Carin},
journal= {arXiv preprint arXiv:2210.09132},
year = {2022}
}
备注
Work in progress