Med-V1:面向零shot 与可扩展生物医学证据归因的小型语言模型
计算与语言
2026-05-19 v2 人工智能
摘要
评估文章是否支持论断是 hallucination 检测和主张验证的关键任务。虽然大型语言模型( LLM)有望自动化此任务,但实现强性能需要像 GPT-5 这样的前沿模型,其部署成本高昂。为高效完成生物医学证据归因,我们提出 Med-V1,一套仅包含三十亿参数的小型语言模型。我们在本研究中新开发的高质量合成数据上训练 Med-V1,在五个统一为验证格式的生物医学基准任务上显著超越 (+27.0%至+71.3%) 其基础模型。尽管规模较小,Med-V1 的性能与前沿 LLM 如 GPT-5 相当,并能提供高质量的预测解释。我们使用 Med-V1 进行首次其种用例研究,量化 LLM 生成答案在不同引用指令下的 hallucination 水平。结果表明,格式指令强烈影响引用有效性和 hallucination,GPT-5 在生成更多主张方面表现更好,但 hallucination 率与 GPT-4o 相似。此外,我们提出第二个用例,表明 Med-V1 能自动识别临床实践指南中的高风险证据误归因,揭示了可能对公共卫生产生负面影响的事项,这些事项在规模化识别中难以察觉。总体而言,Med-V1 为在生物医学证据归因和验证任务中提供一种高效且准确的轻量级替代方案。Med-V1 已在 https://github.com/ncbi-nlp/Med-V1 上发布。
引用
@article{arxiv.2603.05308,
title = {Med-V1: Small Language Models for Zero-shot and Scalable Biomedical Evidence Attribution},
author = {Qiao Jin and Yin Fang and Lauren He and Yifan Yang and Guangzhi Xiong and Zhizheng Wang and Nicholas Wan and Joey Chan and Donald C. Comeau and Robert Leaman and Charalampos S. Floudas and Aidong Zhang and Michael F. Chiang and Yifan Peng and Zhiyong Lu},
journal= {arXiv preprint arXiv:2603.05308},
year = {2026}
}