中文

MedFact:大语言模型在中文医学文本上的事实核查能力基准测试

计算与语言 2025-11-18 v2 人工智能

摘要

在医疗应用中部署大语言模型(LLM)需要具备事实核查能力,以确保患者安全并符合监管合规要求。我们引入了 MedFact,这是一个具有挑战性的中文医学事实核查基准,包含 2,116 个来自多样化真实世界文本的专家标注实例,涵盖 13 个专科、8 种错误类型、4 种写作风格和 5 个难度级别。其构建采用了一种人机混合框架,其中迭代式的专家反馈优化了 AI 驱动的多准则过滤,以确保高质量和高难度。我们在真实性分类和错误定位任务上评估了 20 个领先的 LLM,结果表明模型通常能判断文本是否包含错误,但难以精确对其进行定位,且表现最好的模型也不及人类水平。我们的分析揭示了“过度批评”现象,即模型倾向于将正确信息误判为错误,而多智能体协作和推理时缩放等高级推理技术可能会加剧这一现象。MedFact 突显了部署医疗 LLM 的挑战,并为开发事实可靠的医疗 AI 系统提供了资源。

关键词

引用

@article{arxiv.2509.12440,
  title  = {MedFact: Benchmarking the Fact-Checking Capabilities of Large Language Models on Chinese Medical Texts},
  author = {Jiayi He and Yangmin Huang and Qianyun Du and Xiangying Zhou and Zhiyang He and Jiaxue Hu and Xiaodong Tao and Lixian Lai},
  journal= {arXiv preprint arXiv:2509.12440},
  year   = {2025}
}