中文

我们信任生成式 AI:聊天机器人能否有效核实政治信息?

计算与语言 2023-12-21 v1 计算机与社会

摘要

本文对两个基于大语言模型 (LLM) 的聊天机器人(ChatGPT 和最近更名为 Microsoft Copilot 的 Bing Chat)检测政治信息真实性的能力进行了比较分析。我们使用 AI 审计方法,调查了聊天机器人如何评估关于五个主题的真实、虚假和边界陈述:COVID-19、俄罗斯对乌克兰的侵略、大屠杀、气候变化以及与 LGBTQ+ 相关的辩论。我们通过使用英语、俄语和乌克兰语的提示,比较了聊天机器人在高资源和低资源语言中的表现。此外,我们使用以定义为导向的提示,探讨了聊天机器人根据虚假信息、错误信息和阴谋论等政治传播概念来评估陈述的能力。我们还系统地测试了这种评估如何受到来源偏见的影响,我们通过将特定主张归因于各种政治和社会行为者来对来源偏见进行建模。结果显示,ChatGPT 在基线真实性评估任务中表现优异,在无预训练的情况下,跨语言平均有 72% 的案例被正确评估。Bing Chat 表现稍差,准确率为 67%。我们观察到聊天机器人在评估高资源和低资源语言提示时存在显著差异,并且在根据政治传播概念调整评估时,ChatGPT 比 Bing Chat 提供了更细致的输出。最后,我们发现,对于某些与真实性检测相关的任务,聊天机器人的表现因陈述的主题或归因的来源而异。这些发现突显了基于 LLM 的聊天机器人在应对在线环境中各种形式的虚假信息方面的潜力,但也指出由于提示语言或主题等特定因素,这种潜力的实现存在显著差异。

关键词

引用

@article{arxiv.2312.13096,
  title  = {In Generative AI we Trust: Can Chatbots Effectively Verify Political Information?},
  author = {Elizaveta Kuznetsova and Mykola Makhortykh and Victoria Vziatysheva and Martha Stolze and Ani Baghumyan and Aleksandra Urman},
  journal= {arXiv preprint arXiv:2312.13096},
  year   = {2023}
}

备注

22 pages, 8 figures