中文

GenAI 与人类事实核查员:准确评估但理由存在缺陷

人工智能 2025-02-27 v3 计算与语言

摘要

尽管近期在理解生成式人工智能(GenAI)模型能力与局限方面取得了进展,但我们才刚开始了解其评估和推理信息真实性的能力。我们评估了多个 GenAI 模型,这些模型涉及对信息可信度进行评级以及对其推理过程的感知。我们实验中的信息来自亚州内美国政客在 Facebook 上发布的内容。我们发现,GPT-4o 这一在消费者应用中最常使用的 AI 模型,超过了其他模型,但所有模型仅与人类编码员保持中等一致性。重要的是,即使 GenAI 模型准确识别了低可信度内容,其推理仍严重依赖语言特征和“硬性”标准,如细节程度、来源可靠性和语言正式程度,而非对真实性的理解。我们还评估了总结版与完整内容输入的有效性,发现总结版内容在不牺牲准确性的前提下,具有提升效率的潜力。虽然 GenAI 有望在扩大误information 检测规模方面支持人类事实核查员,但我们的研究结果提醫人不要仅依赖这些模型。

关键词

引用

@article{arxiv.2502.14943,
  title  = {GenAI vs. Human Fact-Checkers: Accurate Ratings, Flawed Rationales},
  author = {Yuehong Cassandra Tai and Khushi Navin Patni and Nicholas Daniel Hemauer and Bruce Desmarais and Yu-Ru Lin},
  journal= {arXiv preprint arXiv:2502.14943},
  year   = {2025}
}

备注

Accepted for publication in the 17th ACM Web Science Conference 2025