中文

指标何时分歧:临床对话评估中的自动相似度 vs. LLM-as-a-Judge

计算与语言 2026-04-01 v2 人工智能

摘要

随着大型语言模型(LLM)越来越多地被集成到医疗保健领域以解决复杂问题,确保其可靠性仍是一个关键挑战。最近的研究表明,通用 LLM 在临床情境下常常表现不佳,偶尔会产生误导性建议。为缓解这些风险,该研究聚焦于使用 Low-Rank Adaptation(LoRA)技术对 Llama-2-7B 进行领域特定适应。通过将可训练的低秩矩阵注入 Transformer 层,我们在保留基础模型知识的同时,使用真实的患者-医生 transcript 高效地适应了该模型。我们的目标是通过捕捉临床话语的特殊细微差别来增强回答医学查询的精度和上下文相关性。由于大规模人类验证资源密集,本研究通过双轨框架评估了该模型的性能:Track A 采用传统词汇相似度指标(如 BLEU、ROUGE),而 Track B 则采用基于 GPT-4 的“LLM-as-a-Judge”范式进行语义评估。我们的结果表明,LoRA 增强模型在所有定量词汇维度上都实现了显著的改进,但在 GPT-4 评估中,发现了显著的分歧,后者略微偏好基线模型的对话流。此指标分歧揭示了一个关键发现:传统的自动化得分可能不完全反映临床实用性。因此,我们提出,尽管自动化指标和 LLM 评判家作为有价值的开发代理是有帮助的,但对于 LLM 在医疗保健领域的安全部署仍然需要人类医学专家进行严格的验证。

关键词

引用

@article{arxiv.2603.00314,
  title  = {When Metrics Disagree: Automatic Similarity vs. LLM-as-a-Judge for Clinical Dialogue Evaluation},
  author = {Bian Sun and Zhenjian Wang and Orvill de la Torre and Zirui Wang},
  journal= {arXiv preprint arXiv:2603.00314},
  year   = {2026}
}