中文

医学推理模型中答案格式的鲁棒性

计算与语言 2026-01-06 v2 机器学习

摘要

医学推理模型 (MRM) 在医学基准测试上取得的准确率优于医学 LLM;然而,仅凭高准确率不足以实现实际部署。一种此类要求用于实际应用的是对不同输出约束的鲁棒性。具体而言,对于相同的医学问题,若请求不同的答案格式,其响应的正确性不应受到影响。我们聚焦于 MRM,调查了这一现象。为量化此行为,我们提出一种指标答案格式鲁棒性:能够可靠地在各种指定格式下生成正确输出的能力。我们检查三种代表性格式:多选题、开放式问答和排序列表。跨 15 个专有和开放权重模型,我们观察到格式鲁棒性存在显著差异 (35-100%)。此外,我们在共享 backbone 上进行受控微调实验,使用匹配的训练数据以隔离微调范式的影响。我们发现,监督微调可实现跨格式的更稳定行为,而强化微调常常表现出更高的跨格式脆弱性,其不稳定程度严重取决于奖励设计。总体而言,医学推理模型中的答案格式鲁棒性是可训练的但脆弱的,需要谨慎评估以实现实际医疗应用。

关键词

引用

@article{arxiv.2509.20866,
  title  = {On the Robustness of Answer Formats in Medical Reasoning Models},
  author = {Pittawat Taveekitworachai and Natpatchara Pongjirapat and Krittaphas Chaisutyakorn and Piyalitt Ittichaiwong and Tossaporn Saengja and Kunat Pipatanakul},
  journal= {arXiv preprint arXiv:2509.20866},
  year   = {2026}
}

备注

62 pages, 47 figures