告诉我为什么:基于大语言模型的可解释公共卫生事实核查
计算与语言
2024-12-19 v1
摘要
本文通过一系列实验对可解释事实核查进行了全面分析,重点关注大语言模型验证公共卫生声明并为其真实性评估提供解释或理由的能力。我们考察了零样本/少样本提示和参数高效微调在各种开源和闭源模型中的有效性,检查它们在真实性预测和解释生成这两个独立任务和联合任务中的表现。重要的是,我们采用了双重评估方法,包括先前建立的自动评估指标和一套通过人工评估的新标准。我们的自动评估表明,在零样本场景中,GPT-4表现突出,但在少样本和参数高效微调背景下,开源模型不仅能够缩小性能差距,而且在某些情况下超越了GPT-4。人工评估揭示了更多细微差别,并指出了黄金解释可能存在的问题。
引用
@article{arxiv.2405.09454,
title = {Tell Me Why: Explainable Public Health Fact-Checking with Large Language Models},
author = {Majid Zarharan and Pascal Wullschleger and Babak Behkam Kia and Mohammad Taher Pilehvar and Jennifer Foster},
journal= {arXiv preprint arXiv:2405.09454},
year = {2024}
}