MLmisFinder:面向机器学习服务滥用的规范与检测方法
软件工程
2026-03-19 v1
摘要
机器学习 (ML) 云服务由亚马逊、谷歌和微软等领先提供商提供,使软件系统能够无需从头构建模型即可集成 ML 组件。然而,随着 ML 服务的快速采用和业务需求的日益复杂,导致 ML 服务依赖系统在质量、可维护性和可演化性方面受到广泛滥用。尽管 prior research 分别研究了面向服务的系统和基于 ML 的系统中的模式与反模式,但自动检测 ML 服务滥用仍是一个挑战。本文提出 MLmisFinder,一种用于检测软件系统中 ML 服务滥用的自动方法,旨在识别 ML 服务使用不当的实例,以帮助开发人员正确地集成 ML 组件到 ML 服务依赖系统中。我们提出一种捕获用于检测 ML 服务依赖系统中滥用的数据的 metamodel,并针对七种滥用类型应用一组基于规则的检测算法。我们在来自开源 GitHub 仓库的 107 个软件系统上对 MLmisFinder 进行了评估,并将其与最新方法进行了比较。我们的结果表明,MLmisFinder 有效地检测到了 ML 服务滥用,平均精确率达到 96.7%,召回率达到 97%,超越了最新方法。MLmisFinder 还高效地扩展到检测 817 个 ML 服务依赖系统,揭示了此类滥用在数据漂移监控和模式验证等领域尤为普遍。
引用
@article{arxiv.2603.17330,
title = {MLmisFinder: A Specification and Detection Approach of Machine Learning Service Misuses},
author = {Hadil Ben Amor and Niruthiha Selvanayagam and Manel Abdellatif and Taher A. Ghaleb and Naouel Moha},
journal= {arXiv preprint arXiv:2603.17330},
year = {2026}
}