MedRECT:临床文本错误纠正的医学推理基准
计算与语言
2025-11-04 v1 人工智能
机器学习
摘要
大型语言模型(LLMs)在医学应用中展现出日益增大的潜力,但其在临床文本中检测和纠正错误的能力——这是安全部署的前提——仍在超英语环境下受到不足评估。我们引入MedRECT——一个跨语言基准(日语/英语),将医学错误处理建模为三个子任务:错误检测、错误定位(句子抽取)和错误纠正。MedRECT由日本医师资格考试(JMLE)和精选英语平行材料的可扩展自动化管道构建而成,分别得到MedRECT-ja(663篇文本)和MedRECT-en(458篇文本),保持可比的错误/无错误比例。我们评估了9个当代LLM,涵盖专有、开源权重和推理家族。关键发现:(i)推理模型在标准架构中显著超越,错误检测提升最高达13.5%,句子抽取提升51.0%;(ii)跨语言评估显示日语较英语低5-10%,推理模型差距较小;(iii)针对性LoRA微调在错误纠正性能上产生不对称提升(日语:+0.078,英语:+0.168),同时保持推理能力;(iv)我们的微调模型在结构化医学错误纠正任务中超越了人类专家。迄今为止,MedRECT是首个针对医学错误纠正的全面跨语言基准,为开发更安全的跨语言医学LLM提供可复现框架和资源。
引用
@article{arxiv.2511.00421,
title = {MedRECT: A Medical Reasoning Benchmark for Error Correction in Clinical Texts},
author = {Naoto Iwase and Hiroki Okuyama and Junichiro Iwasawa},
journal= {arXiv preprint arXiv:2511.00421},
year = {2025}
}