声明检查价值检测:大型语言模型对标注指南的理解程度如何?
计算与语言
2024-10-22 v2
摘要
虚假信息日益增长的威胁要求自动化事实核查流程的部分环节。识别需要事实核查的文本片段被称为声明检测(CD)和声明检查价值检测(CW),后者包含了复杂的领域特定价值标准,通常被构建为排序任务。零样本和少样本的LLM提示对于这两项任务都具有吸引力,因为它绕过了对标注数据集的需求,并允许将口头化的声明和价值标准直接用于提示。我们评估了LLM在来自不同领域的五个CD/CW数据集上的预测和校准准确性,每个数据集使用了不同的价值标准。我们研究了两个关键方面:(1)如何最好地将事实性和价值标准提炼到提示中;(2)为每个声明提供多少上下文。为此,我们尝试了不同的提示详细程度和提供给模型的上下文信息量。我们的结果表明,最佳提示详细程度依赖于领域,添加上下文并不能提高性能,并且置信度分数可以直接用于生成可靠的检查价值排名。
引用
@article{arxiv.2404.12174,
title = {Claim Check-Worthiness Detection: How Well do LLMs Grasp Annotation Guidelines?},
author = {Laura Majer and Jan Šnajder},
journal= {arXiv preprint arXiv:2404.12174},
year = {2024}
}
备注
Accepted to WASSA at EMNLP 2024