基于 LLM 的医学报告因果解释评估:人类对齐指标
计算与语言
2025-06-24 v1 人工智能
摘要
本研究探讨了不同评估指标在自动生成诊断报告中捕捉因果解释质量方面的准确性。我们在两种输入类型(观察基于和多选题基于报告生成)上,对比评估六种指标:BERTScore、余弦相似度、BioSentVec、GPT-White、GPT-Black 以及专家定性评估。应用了两种权重策略:一种反映任务特定的优先级,另一种为所有指标分配相等权重。我们的结果表明,GPT-Black 在识别逻辑连贯且临床上有效的因果叙事方面表现最佳。GPT-White 也与专家评估良好一致,而基于相似度的指标则与临床推理质量不一致。这些发现强调了指标选择和权重设置对评估结果的影响,支持使用基于 LLM 的评估来处理需要可解释性和因果推理的任务。
引用
@article{arxiv.2506.18387,
title = {Evaluating Causal Explanation in Medical Reports with LLM-Based and Human-Aligned Metrics},
author = {Yousang Cho and Key-Sun Choi},
journal= {arXiv preprint arXiv:2506.18387},
year = {2025}
}
备注
9 pages, presented at LLM4Eval Workshop, SIGIR 2025 Padova, Italy, July 17, 2025