野外机器学习:开源软件中非合规 ML 自动化的早期证据
软件工程
2026-04-01 v1
摘要
机器学习(ML)模型,特别是基础模型,其日益增多的可用性使其能够跨越各种下游应用场景,从数据缺失的场景到安全关键的情境。原则上,这可能违反模型的使用条款,以及政府原则和法规。本文 presenting 对 173 个 GitHub 上的开源项目中 ML 模型使用的 preliminary investigation,涵盖 16 个应用领域。我们评估这些模型是否用于做出决策、这些决策的范围以及是否存在后处理措施以减少完全自主系统固有的风险。最后,我们调查这些模型是否遵守既定的使用条款。本研究为定义开发人员的指南并创建自动识别软件系统中 ML 模型潜在违规行为的分析工具奠定了基础。
引用
@article{arxiv.2603.29698,
title = {Machine Learning in the Wild: Early Evidence of Non-Compliant ML-Automation in Open-Source Software},
author = {Zohaib Arshid and Daniele Bifolco and Fiorella Zampetti and Massimiliano Di Penta},
journal= {arXiv preprint arXiv:2603.29698},
year = {2026}
}