中文

MIRA:医疗信息响应审计的双语基准

人工智能 2026-05-28 v1 计算与语言 计算机与社会

摘要

大型语言模型 (LLM) 越来越多地用于提供面向公众的健康信息,但现有的安全评估忽略了响应在不同用户措辞下的医疗信息保护程度。为此,我们引入医疗信息响应审计 (MIRA),一个双语、受控基准,用于评估 LLM 是否在不同用户侧语言、语态和健康素养信号下提供可 comparable 的医疗信息。MIRA 包含由 60 个医学审核、低风险健康问题构建的 4,320 个提示。我们测试了五个主流 LLM,模型回答了所有医疗问题,但针对低健康素养信号的响应 consistently 遗漏了更多关键信息、提供了更少的具体后续步骤、并为独立判断提供了更少支持。我们称之为差异信息稀释 (DID)。语言效应是模型特定的,而非对非英文提示统一更差。与 300 个真实世界健康查询的比较提供了秩序有效性的初步证据。知识导向的缓解提示对大多数模型减少信息稀释,其中 Claude (~8%) 和 Qwen (~6%) 的非信息化简现象降低幅度最大。

关键词

引用

@article{arxiv.2605.28025,
  title  = {MIRA: A Bilingual Benchmark for Medical Information Response Audit},
  author = {Mengyu Xu and Qiaoxin Yang and Qianqian Wang and Xiwei Dai and Weiyi Wu and Chongyang Gao},
  journal= {arXiv preprint arXiv:2605.28025},
  year   = {2026}
}