中文

大型语言模型对报纸政治倾向的检测

计算与语言 2024-06-04 v1 信息检索

摘要

如果报纸对政治或经济倾向的立场模糊不清,民主意见的形成可能会受到操纵。为了更好理解报纸的立场,人们已经开发了各种方法。最近,大型语言模型(LLM)的出现,特别是像ChatGPT或Gemini这样的预训练LLM聊天机器人,具有帮助研究人员和公民的颠覆性潜力。然而,关于LLM评估是否值得信赖,我们知之甚少:单个LLM是否与专家评估一致,以及不同的LLM是否彼此一致地回答?在本文中,我们专门针对第二个挑战。我们比较了四种广泛使用的LLM如何评价报纸的立场,并比较它们的答案是否相互一致。我们观察到情况并非如此。在一个全球数据集中,单个LLM对报纸文章的立场评价差异显著,这暗示了训练不一致或算法中过度的随机性。因此,我们在决定使用哪些工具时提出警告,并呼吁进行更好的训练和算法开发,以弥补这个对全球民主和社会高度敏感问题中的重大差距。我们还通过我们的开放倡议navai.pro呼吁社区参与基准评估。

关键词

引用

@article{arxiv.2406.00018,
  title  = {Large Language Models' Detection of Political Orientation in Newspapers},
  author = {Alessio Buscemi and Daniele Proverbio},
  journal= {arXiv preprint arXiv:2406.00018},
  year   = {2024}
}