(事实)核查您的偏见
计算与语言
2025-06-30 v1
摘要
自动事实核查系统越来越依赖大型语言模型(LLM)。我们调查这些模型的参数知识偏见如何影响HerO系统(FEVER-25的基准系统)的事实核查结果。我们检验系统受到:(1) Llama 3.1参数知识的潜在偏见,以及(2)人为注入的偏见。当直接要求模型进行事实核查时,Llama 3.1将近一半的论点标记为"证据不足"。仅凭其参数知识即可对剩余一半的论点作出判断。在第二个实验中,我们要求模型生成支持、反驳或中性事实核查文件。这些提示显著影响检索结果,其中约50%的检索证据因提示策略而异。值得注意的是,模型有时会拒绝为其认为错误的论点生成支持文件,导致内在的负向偏见。尽管检索证据存在差异,最终的裁决预测在不同提示策略下保持稳定。代码可在:https://github.com/eibakke/FEVER-8-Shared-Task 获取。
引用
@article{arxiv.2506.21745,
title = {(Fact) Check Your Bias},
author = {Eivind Morris Bakke and Nora Winger Heggelund},
journal= {arXiv preprint arXiv:2506.21745},
year = {2025}
}