中文

面向可解释替代模型的主动路由:分布无关安全保证

机器学习 2026-03-17 v1

摘要

模型路由决定是否使用准确但黑箱模型或更简单可解释的替代模型。在部署场景中,实践者常希望限制替代模型在特定输入上的性能下降。我们研究主动(基于输入)路由,即轻量级门控器在任一模型运行前选择模型,从而实现对路由输入集合中性能下降超出容忍阈值 τ\tau 的比例进行分布无关控制。门控器训练于区分安全与不安全输入,路由阈值通过 Clopper-Pearson 共轭校准选定,保证路由集合违规率至多为 α\alpha。我们推导安全路由与基准安全率 π\pi 及风险预算 α\alpha 之间的可行性条件,以及确保可行路由的充分 AUC 阈值。跨 35 个 OpenML 数据集和多种黑箱模型族,基于门控的共轭路由在控制违规的同时,显著高于回归共轭和朴素基线的覆盖率。我们进一步表明概率校准主要影响路由效率而非分布无关有效性。

关键词

引用

@article{arxiv.2603.14623,
  title  = {Proactive Routing to Interpretable Surrogates with Distribution-Free Safety Guarantees},
  author = {Iqtedar Uddin and Mazin Khider and André Bauer},
  journal= {arXiv preprint arXiv:2603.14623},
  year   = {2026}
}