基于对抗性反馈的实时事实性评估
计算与语言
2025-07-29 v3 人工智能
摘要
我们指出,现有的评估方法(例如基于事实核查网站声称的评估方法)对于 LLM 基于检测器的结果在时间上表现出高准确率——即使在其知识截止日期之后也是如此。这表明,由于这些来源的假信息可能容易被识别,这是由于它们可能出现在预训练/检索语料库中,或这些数据集中出现显著但浅薄的模式。相反,我们认为,proper factuality evaluation 数据集应测试模型推理能力,以检索和阅读相关证据。为此,我们开发了一种新型管道,利用来自基于 RAG 检测器的自然语言反馈,迭代地修改真实新闻以生成具有对抗性的变体,这些变体挑战 LLMs。我们的迭代重写使强大的基于 RAG 的 GPT-4o 检测器的二元分类 ROC-AUC 降低了绝对 17.5 个百分点。我们的实验揭示了 RAG 在评估和生成具有挑战性的新闻示例方面的重要作用:没有 RAG 的 LLM 检测器对未见事件和对抗攻击极其脆弱,而 RAG 基于评估的反馈有助于发现更具欺骗性的模式。
引用
@article{arxiv.2410.14651,
title = {Real-time Factuality Assessment from Adversarial Feedback},
author = {Sanxing Chen and Yukun Huang and Bhuwan Dhingra},
journal= {arXiv preprint arXiv:2410.14651},
year = {2025}
}