中文

基于真实与生成新闻文章语料库的生成式媒体偏见量化

计算与语言 2024-06-18 v1 人工智能

摘要

大型语言模型(LLMs)正在被越来越多地用于各种任务和领域,尤其是在新闻业领域的应用受到广泛关注。这一趋势引发了担忧,因为我们对LLMs在该领域行为的了解有限,尤其是关于政治偏见。现有研究主要聚焦于LLMs完成政治问卷调查,这只能提供有限的关于其偏见及操作细节的见解。为此,我们建立了一个新建构的数据集,包含2100篇人工撰写的文章,并利用其描述生成56700篇由九个LLMs生成的合成文章。这使我们能够分析人工撰写文章与机器生成文章之间的属性变化,本研究聚焦于政治偏见,使用监督模型和LLMs进行检测。我们的发现表明,基础模型与指令调优模型之间存在显著差异,指令调优模型表现出一致的政治偏见。此外,我们能够研究LLMs作为分类器的行为,观察到它们在该角色中也表现出政治偏见。总体而言,本研究首次在新闻领域概述了框架并提供了结构化数据集,用于可量化的实验,为进一步研究LLMs政治偏见及其影响提供了基础。

关键词

引用

@article{arxiv.2406.10773,
  title  = {Quantifying Generative Media Bias with a Corpus of Real-world and Generated News Articles},
  author = {Filip Trhlik and Pontus Stenetorp},
  journal= {arXiv preprint arXiv:2406.10773},
  year   = {2024}
}

备注

20 pages, 10 figures