FActBench:面向医疗领域大语言模型生成文本的细粒度自动评估基准
计算与语言
2025-09-03 v1
摘要
大型语言模型在处理专业领域时常常表现不佳。尽管评估的各个方面都很重要,但事实性是最关键的方面。同样,可靠的事实核查工具和数据源对于缓解幻觉现象至关重要。我们通过提供覆盖医疗领域四个生成任务和六个最先进大型语言模型(LLM)的全面事实核查基准 FActBench 来解决上述问题。我们采用两种最先进事实核查技术:链式思维(Chain-of-Thought, CoT)提示和自然语言推理(Natural Language Inference, NLI)。我们的实验表明,通过两种技术 unanimous voting(一致投票)获得的事实核查分数与领域专家评估之间相关性最佳。
引用
@article{arxiv.2509.02198,
title = {FActBench: A Benchmark for Fine-grained Automatic Evaluation of LLM-Generated Text in the Medical Domain},
author = {Anum Afzal and Juraj Vladika and Florian Matthes},
journal= {arXiv preprint arXiv:2509.02198},
year = {2025}
}