指数族分布{\epsilon}-安全决策区域的精确刻画与多成本SVM近似
机器学习
2025-01-30 v1 人工智能
机器学习
摘要
数据驱动分类器的预测需要概率保证,以定义可信赖的模型。这是现代机器学习中的关键要求,其良好程度以可信赖性衡量,明确划分安全区域与不安全区域。本文正沿着这一方向推进。首先,我们提出{\epsilon}-安全决策区域({\epsilon}-Safe Decision Region)的正式定义,这是输入空间中的一个子集,保证目标(安全)类别的预测具有概率保障。其次,我们证明当数据来源于指数族分布时,该区域的形式是可分析确定且可通过设计参数可控的,即目标类别抽样概率和预测置信度。然而,始终不可能要求数据服从指数分布。针对这一局限,我们发展了多成本SVM(Multi Cost SVM)算法,该算法能够近似安全区域,同时能够处理不平衡数据。本研究附带实验,并提供可复现的代码。
引用
@article{arxiv.2501.17731,
title = {Exact characterization of {\epsilon}-Safe Decision Regions for exponential family distributions and Multi Cost SVM approximation},
author = {Alberto Carlevaro and Teodoro Alamo and Fabrizio Dabbene and Maurizio Mongelli},
journal= {arXiv preprint arXiv:2501.17731},
year = {2025}
}