中文

TRUST-LAPSE:一种用于模型监测的可解释且可操作的不可信度评分框架

机器学习 2023-07-14 v2 人工智能

摘要

对训练好的 ML 模型进行持续监测以确定其预测何时可信与不可信,对其安全部署至关重要。此类框架应具备高性能、可解释、事后和可操作的特点。我们提出 TRUST-LAPSE,一种用于持续模型监测的“不可信”评分框架。我们利用一系列潜空间嵌入来评估每个输入样本模型预测的可信度。具体而言,(a) 我们的潜空间不可信分数利用潜空间中的距离度量(马氏距离)和相似度度量(余弦相似度)估计不可信度;(b) 我们的序列不可信分数通过一种非参数、基于滑动窗口的算法确定过去输入表示序列上相关性的偏移,以实现可操作的持续监测。我们通过两项下游任务评估 TRUST-LAPSE:(1) 分布偏移输入检测,以及 (2) 数据漂移检测。我们在多个领域评估——使用公开数据集的音频与视觉,并进一步在具有挑战性的真实世界脑电图(EEG)癫痫检测数据集上基准测试我们的方法。我们的潜空间不可信分数取得了 SOTA 结果,AUROC 分别为 84.1(视觉)、73.9(音频)和 77.1(临床 EEG),超越基线逾 10 个点。我们揭示了流行基线中的关键失效:它们对输入语义内容不敏感,因而不适用于真实世界模型监测。我们展示我们的序列不可信分数实现了高漂移检测率;所有领域中超过 90% 的流显示误差 < 20%。通过广泛的定性与定量评估,我们表明我们的不可信分数更鲁棒,并提供可解释性以便易于投入实践。

关键词

引用

@article{arxiv.2207.11290,
  title  = {TRUST-LAPSE: An Explainable and Actionable Mistrust Scoring Framework for Model Monitoring},
  author = {Nandita Bhaskhar and Daniel L. Rubin and Christopher Lee-Messer},
  journal= {arXiv preprint arXiv:2207.11290},
  year   = {2023}
}

备注

Keywords: Mistrust Scores, Latent-Space, Model monitoring, Trustworthy AI, Explainable AI, Semantic-guided AI