中文

从预标注到生产:公共部门机器学习管道的工程经验教训

软件工程 2025-11-04 v1 计算机与社会

摘要

机器学习越来越多地被嵌入到政府数字平台中,但公共部门的约束条件使构建准确、可审计且操作可持续的 ML 系统变得困难。在实际操作中,团队不仅面临像极端类别不平衡和数据漂移等技术问题,还面临官僚数据访问、缺乏版本化数据集以及对数据源头和监控治理不完整等组织障碍。我们对 Brasil Participativo (BP) 平台的研究显示,诸如使用 LLM 进行预标注、将模型拆分为路由分类器以及生成合成数据等常见工程选择——可以加快开发进度,但如果没有配合严格的数据治理和人工验证,也会引入新的可追溯性、可靠性和成本风险。这意味着,在公共部门,负责任的 ML 不仅仅是一个建模问题,而是一个制度工程问题,ML 管道必须被视为公民基础设施。最终,本研究表明,机器学习在公共部门的成功将取决于制度能够构建透明、可重复且可信赖的数据基础设施的能力,而不仅仅是模型准确性突破。

关键词

引用

@article{arxiv.2511.01545,
  title  = {From Pre-labeling to Production: Engineering Lessons from a Machine Learning Pipeline in the Public Sector},
  author = {Ronivaldo Ferreira and Guilherme da Silva and Carla Rocha and Gustavo Pinto},
  journal= {arXiv preprint arXiv:2511.01545},
  year   = {2025}
}

备注

11 pages, 2 figures, 4 tables