未知感知机器学习的基础
机器学习
2025-05-22 v1
摘要
确保机器学习模型在开放式部署中的可靠性与安全性是人工智能安全的核心挑战。本论文在算法和理论层面构建了框架,以解决分布式不确定性和未知类别所引发的关键可靠性问题,从传统神经网络到现代基础模型如大语言模型(LLM)。传统学习范例,如经验风险最小化(ERM),假设训练与推理之间不存在分布迁移,常导致对离群分布(OOD)输入预测过于自信。本论文引入新型框架,联合优化分布内准确性和对未知数据的可靠性。核心贡献是开发未知感知学习框架,使模型能够在无需标记 OOD 数据的情况下识别和处理新输入。我们提出新的离群合成方法 VOS、NPOS 和 DREAM-OOD,以生成训练期间有信息的未知样本。基于此,我们提出 SAL 框架,利用无标签的野外数据增强 OOD 检测,提供在真实部署条件下的形式可靠性保证。这些方法表明,丰富的无标签数据可被用于识别和适应意外输入。论文还将可靠学习扩展至基础模型,开发了用于 LLM 幻觉检测的 HaloScope、用于多模态模型防御恶意提示的 MLLMGuard,以及用于改进人类反馈对齐的数据清洗方法。这些工具针对威胁大规模模型部署安全的失效模式。总体而言,这些贡献将未知感知学习作为新范式推广,并希望推动 AI 系统在最小人工 effort 下提升可靠性。
引用
@article{arxiv.2505.14933,
title = {Foundations of Unknown-aware Machine Learning},
author = {Xuefeng Du},
journal= {arXiv preprint arXiv:2505.14933},
year = {2025}
}
备注
PhD Dissertation