面向可解释替代模型的主动路由:分布无关安全保证
机器学习
2026-03-17 v1
摘要
模型路由决定是否使用准确但黑箱模型或更简单可解释的替代模型。在部署场景中,实践者常希望限制替代模型在特定输入上的性能下降。我们研究主动(基于输入)路由,即轻量级门控器在任一模型运行前选择模型,从而实现对路由输入集合中性能下降超出容忍阈值 的比例进行分布无关控制。门控器训练于区分安全与不安全输入,路由阈值通过 Clopper-Pearson 共轭校准选定,保证路由集合违规率至多为 。我们推导安全路由与基准安全率 及风险预算 之间的可行性条件,以及确保可行路由的充分 AUC 阈值。跨 35 个 OpenML 数据集和多种黑箱模型族,基于门控的共轭路由在控制违规的同时,显著高于回归共轭和朴素基线的覆盖率。我们进一步表明概率校准主要影响路由效率而非分布无关有效性。
引用
@article{arxiv.2603.14623,
title = {Proactive Routing to Interpretable Surrogates with Distribution-Free Safety Guarantees},
author = {Iqtedar Uddin and Mazin Khider and André Bauer},
journal= {arXiv preprint arXiv:2603.14623},
year = {2026}
}