Polysemantic Dropout:面向专用 LLM 的共形 OOD 检测
计算与语言
2025-09-17 v2 人工智能
摘要
我们提出了一种用于专用大语言模型(LLM)的推理时域外(OOD)检测新算法。尽管通过微调在域内任务上取得了 SOTA 性能,专用 LLM 在面对 OOD 输入时仍易产生错误或不可靠的输出,这在关键应用中构成风险。我们的方法利用归纳共形异常检测(ICAD)框架,采用一种基于模型 dropout 容忍度的新非一致性度量。受近期关于 LLM 中多义性与冗余性的发现启发,我们假设域内输入比 OOD 输入具有更高的 dropout 容忍度。我们通过有效的集成方法聚合多层间的 dropout 容忍度,在改进检测的同时维持 ICAD 的理论误报界限。在医学专用 LLM 上的实验表明,我们的方法优于基线方法,在将 OOD 数据点视为正例、域内测试数据点视为负例时,AUROC 提升 至 。
引用
@article{arxiv.2509.04655,
title = {Polysemantic Dropout: Conformal OOD Detection for Specialized LLMs},
author = {Ayush Gupta and Ramneet Kaur and Anirban Roy and Adam D. Cobb and Rama Chellappa and Susmit Jha},
journal= {arXiv preprint arXiv:2509.04655},
year = {2025}
}
备注
Accepted to EMNLP 2025 main conference