两个LLM比一个更好吗?一种用于制药内容优化的学生-教师双头LLM架构
机器学习
2026-02-13 v1
摘要
大型语言模型(LLM)越来越多地被用于在制药等受监管领域创建内容,这些领域的输出必须科学准确且符合法律规定。手动质量控制(QC)速度慢、容易出错,并可能成为发布的瓶颈。我们引入了LRBTC,一种模块化的LLM和视觉语言模型(VLM)驱动的QC架构,涵盖语言、法规、品牌、技术和内容结构检查。LRBTC结合了学生-教师双模型架构、人在回路(HITL)工作流和瀑布规则过滤,以实现可扩展、可验证的内容验证和优化。在AIReg-Bench上,我们的方法达到了83.0%的F1分数和97.5%的召回率,与Gemini 2.5 Pro相比,漏检违规减少了5倍。在CSpelling上,它将平均准确率提高了26.7%。错误分析进一步揭示,虽然当前模型在检测拼写错误方面很强(召回率92.5),但它们未能识别复杂的医学语法(召回率25.0)和标点符号(召回率41.7)错误,这突出了一个未来工作的关键领域。这项工作为高风险、合规关键行业中可靠、透明的内容质量控制提供了一种实用的即插即用解决方案。我们还根据MIT许可证提供了我们的演示访问。
引用
@article{arxiv.2602.11957,
title = {Are Two LLMs Better Than One? A Student-Teacher Dual-Head LLMs Architecture for Pharmaceutical Content Optimization},
author = {Suyash Mishra and Qiang Li and Anubhav Girdhar},
journal= {arXiv preprint arXiv:2602.11957},
year = {2026}
}
备注
Submitted to the Demo Track of Top Tier Conference; currently under peer review