中文

医学文本 LLM 水印方法的事实性评估

计算与语言 2025-09-23 v2 密码学与安全

摘要

随着大语言模型(LLM)被适应医学等敏感领域,其流畅性带来了安全风险,尤其是关于来源和问责。水印通过嵌入可检测模式来缓解这些风险,但其在医学语境下的可靠性尚未得到测试。现有基准关注检测质量与效果之间的权衡,忽略了事实风险。在医学文本中,水印常对低熵记号进行重新加权,这些记号高度可预测且常携带关键医学术语。将这些记号移位可能导致不准确和幻觉,此类风险未被现有通用领域基准捕捉。我们提出一种面向医学的评估工作流程,联合评估事实准确性和连贯性。通过 GPT-Judger 及人类验证,我们引入 Factuality-Weighted Score(FWS),这是一种以事实准确性为核心、超越连贯性的复合指标,用于指导在医学领域部署水印。我们的评估显示,当前水印方法在医学事实性上会出现显著损失,熵值偏移会损害医学实体表征。这些发现凸显了需要面向医学领域的水印方法,以保持医学内容完整性的必要性。

关键词

引用

@article{arxiv.2509.07755,
  title  = {Factuality Beyond Coherence: Evaluating LLM Watermarking Methods for Medical Texts},
  author = {Rochana Prih Hastuti and Rian Adam Rajagede and Mansour Al Ghanim and Mengxin Zheng and Qian Lou},
  journal= {arXiv preprint arXiv:2509.07755},
  year   = {2025}
}

备注

Accepted at EMNLP 2025 Findings. Camera Ready