中文

Global-Liar:大语言模型在不同时间和地理区域的事实性

计算与语言 2024-02-01 v1 人工智能 信息检索

摘要

对人工智能驱动解决方案,特别是像 GPT 系列这样的大语言模型(LLM),在信息检索方面日益增长的依赖,凸显了对其事实性和公平性的迫切需求,尤其是在错误信息和虚假信息在线泛滥的背景下。我们的研究评估了广泛采用的 GPT 模型(包括 GPT-3.5 和 GPT-4)的事实准确性、稳定性和偏差,为 AI 介导的信息传播的可靠性和完整性做出贡献。我们引入了 'Global-Liar',这是一个在地理和时间代表性方面独特平衡的数据集,有助于对 LLM 偏差进行更细致的评估。我们的分析揭示,GPT 模型的较新迭代并不总是等同于性能的提升。值得注意的是,3 月版的 GPT-4 比其后续 6 月版表现出更高的事实准确性。此外,我们观察到一种令人担忧的偏见,即优先考虑来自全球北方的陈述而非全球南方,从而可能加剧现有的信息不平等。非洲和中东等地区处于不利地位,其事实准确性要低得多。随时间变化的性能波动表明,模型更新可能不会平等地惠及所有地区。我们的研究还提供了关于各种 LLM 配置设置(如二元决策强制、模型重新运行和温度)对模型事实性影响的见解。被限制为二元(真/假)选择的模型与允许 '不清楚' 选项的模型相比,表现出较低的事实性。在低温度设置下的单次推理与各种配置下的多数投票的可靠性相匹配。所获得的见解凸显了对文化多样性和地理包容性模型训练与评估的需求。这种方法对于实现技术的全球公平、在全球范围内公平分配 AI 利益至关重要。

关键词

引用

@article{arxiv.2401.17839,
  title  = {Global-Liar: Factuality of LLMs over Time and Geographic Regions},
  author = {Shujaat Mirza and Bruno Coelho and Yuyuan Cui and Christina Pöpper and Damon McCoy},
  journal= {arXiv preprint arXiv:2401.17839},
  year   = {2024}
}

备注

24 pages, 12 figures, 9 tables