中文

超越人类水平:面向药品制造质量控制的视觉语言多智能体方法

计算机视觉与模式识别 2026-02-25 v1

摘要

培养形成单元(CFU)检测是药品制造中的关键环节,是环境监测计划的重要组成部分,确保符合严格的质量标准。人工计数耗时且易出错,而深度学习(DL)方法虽准确,但对样本质量变化和伪影仍敏感。基于我们之前的CNN框架(Beznik 等,2020),我们评估了YOLOv5、YOLOv7和YOLOv8用于CFU检测;但仅达到97.08%的准确率,尚不足以满足药品级要求。在GSK拥有超过5万张培养皿图像的数据集上训练的自定义Detectron2模型实现了99%的检测率,误报为2%,误报为0.6%。尽管验证准确率高,但在包括受污染平板、塑料制品或光学模糊等异常情况时,Detectron2性能会下降。为此,我们开发了结合深度学习与视觉语言模型(VLM)的多智能体框架。VLM智能体首先对平板进行有效性分类。对于有效样本,深度学习和VLM智能体独立估计算子数量。当预测值在5%以内一致时,结果自动记录到Postgres和SAP;否则,样本被路由进行专家审核。专家反馈实现持续再训练和自我改进。初始基于深度学习的自动化方案使疫苗制造各站点的人工审核减少50%。随着VLM集成,这一比例提升至85%,实现显著的运营成本节约。该系统提供了一个可扩展、可审计且符合监管要求的微生物质量控制解决方案,推动了生物药生产中的自动化进程。

关键词

引用

@article{arxiv.2602.20543,
  title  = {Beyond Human Performance: A Vision-Language Multi-Agent Approach for Quality Control in Pharmaceutical Manufacturing},
  author = {Subhra Jyoti Mandal and Lara Rachidi and Puneet Jain and Matthieu Duvinage and Sander W. Timmer},
  journal= {arXiv preprint arXiv:2602.20543},
  year   = {2026}
}