使用大语言模型进行事实核查的风险与前景
计算与语言
2024-02-08 v2 计算机与社会
人机交互
摘要
自动化事实核查利用机器学习来验证声明,随着错误信息传播超出人类事实核查能力,其重要性日益增长。诸如 GPT-4 之类的大语言模型(LLMs)正日益被信任用于撰写学术论文、诉讼文书、新闻文章并核实信息,这凸显了它们在辨别真伪中的作用以及验证其输出的重要性。因此,理解 LLMs 在事实核查任务中的能力与局限,对保障信息生态健康至关重要。在此,我们通过让 LLM 智能体拟定查询、检索上下文数据并做出判断,评估其在事实核查中的使用。重要的是,在我们的框架中,智能体解释其推理并引用检索上下文中的相关来源。我们的结果显示了 LLMs 在获得上下文信息后能力的增强。GPT-4 优于 GPT-3,但准确率随查询语言与声明真伪而变化。尽管 LLMs 在事实核查中展现出前景,但因准确率不稳定,仍需保持谨慎。我们的研究呼吁进一步探索,以深化对智能体成功与失败条件的理解。
引用
@article{arxiv.2310.13549,
title = {The Perils & Promises of Fact-checking with Large Language Models},
author = {Dorian Quelle and Alexandre Bovet},
journal= {arXiv preprint arXiv:2310.13549},
year = {2024}
}