LLM 在差分测试中的核心作用:一项医学规则引擎案例研究
软件工程
2025-03-03 v4 人工智能
摘要
挪威癌症登记中心 (CRN) 使用自动化癌症登记支持系统 (CaReSS) 以支持核心癌症登记活动,即数据捕获、数据治理以及为 various 利益相关者生产数据产品和统计信息。GURI 是 CaReSS 的核心组件,负责验证来自医学规则的输入数据。此类医学规则是由医学专家基于医学标准、法规和研究手动实现的。鉴于大型语言模型 (LLM) 已在包括这些文件在内的大量公共信息上进行训练,它们可以用于生成 GURI 的测试。因此,我们提出一种基于 LLM 的测试生成和差分测试方法 (LLMeDiff) 来测试 GURI。我们使用四种不同的 LLM、两个医学规则引擎实现以及 58 条真实医学规则来调查 LLM 生成测试的幻觉情况、成功情况、时间效率以及对 GURI 生成测试鲁棒性的表现,以及这些测试发现 GURI 潜在问题的能力。我们的结果显示,GPT-3.5 幻觉最少、最成功、通常最鲁棒;然而,它在时间效率方面最差。我们的差分测试发现了 22 条医学规则,其中存在实施不一致(例如关于处理规则版本的方式)。最后,我们根据结果为实践者和研究者提供了见解。
引用
@article{arxiv.2404.03664,
title = {LLMs in the Heart of Differential Testing: A Case Study on a Medical Rule Engine},
author = {Erblin Isaku and Christoph Laaber and Hassan Sartaj and Shaukat Ali and Thomas Schwitalla and Jan F. Nygård},
journal= {arXiv preprint arXiv:2404.03664},
year = {2025}
}
备注
12 pages, 6 figures, 4 tables, 1 listing, revised arguments