利用合成数据生成进行分布外检测
计算与语言
2025-10-03 v2 人工智能
机器学习
摘要
区分分布内(in-distribution)与分布外(out-of-distribution, OOD)输入对于分类系统的可靠部署至关重要。然而,OOD 数据通常不可用或难以收集,这给精确的 OOD 检测带来了重大挑战。在本工作中,我们提出了一种方法,利用大型语言模型(Large Language Models, LLMs)的生成能力来创建高质量的合成 OOD 代理,从而消除对外部 OOD 数据源的依赖。我们研究了该方法在经典文本分类任务(如毒性检测和情感分类)以及 LLM 开发与部署中出现的分类任务(如为 RLHF 训练奖励模型和检测未对齐的生成)上的有效性。在九个 InD-OOD 数据集对和多种模型规模上的大量实验表明,我们的方法显著降低了假阳性率(在某些情况下实现了完美的零假阳性率),同时保持了在分布内任务上的高准确率,大幅优于基线方法。
引用
@article{arxiv.2502.03323,
title = {Out-of-Distribution Detection using Synthetic Data Generation},
author = {Momin Abbas and Muneeza Azmat and Raya Horesh and Mikhail Yurochkin},
journal= {arXiv preprint arXiv:2502.03323},
year = {2025}
}
备注
Accepted to COLM 2025. Camera-ready version