中文

AllMetrics:一个用于机器学习中标准化度量评估和鲁棒数据验证的统一Python库

机器学习 2025-05-23 v1

摘要

机器学习(ML)模型严重依赖一致且准确的性能度量来评估和比较其有效性。然而,现有库常常存在碎片化、实现不一致以及数据验证协议不足的问题,导致结果不可靠。现有库通常是独立开发的,且未遵循统一标准,特别是在它们旨在支持的具体任务方面。因此,每个库倾向于在度量计算、输入/输出格式、错误处理和数据验证协议上采用各自的惯例。这种标准化的缺乏导致了实现差异(ID)和报告差异(RD),使得跨框架比较结果或确保可靠评估变得困难。为解决这些问题,我们引入了AllMetrics,这是一个开源的统一Python库,旨在标准化跨多种ML任务的度量评估,包括回归、分类、聚类、分割和图像到图像转换。该库通过可配置参数为多类任务实现了特定于类的报告,以覆盖所有用例,同时结合特定于任务的参数来解决跨实现的度量计算差异。我们将来自医疗保健、金融和房地产等领域的各种数据集应用于我们的库,并与Python、Matlab和R组件进行比较,以识别哪些产生了相似的结果。AllMetrics将模块化应用程序编程接口(API)与鲁棒的输入验证机制相结合,以确保模型评估的可复现性和可靠性。本文介绍了其设计原则、架构组件和实证分析,证明了其减少评估错误和增强ML工作流可信度的能力。

关键词

引用

@article{arxiv.2505.15931,
  title  = {AllMetrics: A Unified Python Library for Standardized Metric Evaluation and Robust Data Validation in Machine Learning},
  author = {Morteza Alizadeh and Mehrdad Oveisi and Sonya Falahati and Ghazal Mousavi and Mohsen Alambardar Meybodi and Somayeh Sadat Mehrnia and Ilker Hacihaliloglu and Arman Rahmim and Mohammad R. Salmanpour},
  journal= {arXiv preprint arXiv:2505.15931},
  year   = {2025}
}