中文

JMedEthicBench:用于评估日本大型语言模型医疗安全的多轮对话基准

计算与语言 2026-05-28 v3 人工智能

摘要

随着大型语言模型(LLM)在医疗领域的部署日益增多,对其医疗安全进行仔细评估变得至关重要。然而,现有的安全基准仍以英语为主,且仅使用单轮提示进行测试,尽管临床咨询是多轮进行的。为此,我们引入 JMedEthicBench,这是首个用于评估日本医疗领域大型语言模型医疗安全的多轮对话基准。我们的基准基于日本医师协会的 67 项指南,包含超过 50,000 条使用七种自动发现的越狱策略生成的对抗性对话。使用双 LLM 评分协议,我们评估了 27 个模型,发现商业模型保持稳健的安全性,而医学专业化模型则显示出增加的脆弱性。此外,随着对话轮数的增加,安全得分显著下降(中位数:9.5 降至 5.0,p<0.001p < 0.001)。跨语言评估表明,医学模型的脆弱性在不同语言间都存在,这表明是对齐限制的本质问题,而非语言特定因素。这些发现表明,领域特定的微调可能意外削弱安全机制,而多轮交互则代表了一个需要专门对齐策略的不同威胁表面。

关键词

引用

@article{arxiv.2601.01627,
  title  = {JMedEthicBench: A Multi-Turn Conversational Benchmark for Evaluating Medical Safety in Japanese Large Language Models},
  author = {Junyu Liu and Zirui Li and Qian Niu and Zequn Zhang and Yue Xun and Wenlong Hou and Shujun Wang and Yusuke Iwasawa and Yutaka Matsuo and Kan Hatakeyama-Sato},
  journal= {arXiv preprint arXiv:2601.01627},
  year   = {2026}
}

备注

12 pages, 6 figures