中文

衡量大型语言模型 annotating 记者来源的能力

计算与语言 2025-04-04 v2 计算机与社会

摘要

自 2022 年底 ChatGPT 问世以来,大型语言模型及其评估能力在学术研究和产业界不断讨论与评估。已在多个领域开发了情景和基准测试,如法律、医疗和数学(Bommasani 等,2023),并持续评估模型变体。一个尚未得到足够情景开发关注的领域是新闻学,特别是新闻来源和伦理。新闻是民主中关键的真理确定功能(Vincent,2023),而来源是所有原始新闻产出的关键支柱。评估大型语言模型在识别和标注新闻故事中不同来源信号以及记者如何论证这些来源的能力,是一个值得采用基准方法进行评估的情景。这为构建自动化系统以对比更透明和伦理严谨的新闻形式与日常新闻提供了潜力。本文我们阐述了一个评估大型语言模型在新闻故事中识别和标注来源的情景,使用灵感来自新闻研究(Gans,2004)的五级分类方案。我们提供了使用案例、数据集和指标,并作为系统性基准测试的第一步。我们的准确率发现表明,基于大型语言模型的方法在识别故事中所有来源陈述方面还有提升空间,同样在匹配来源类型方面也有挑战。更难的任务是识别来源论证。

关键词

引用

@article{arxiv.2501.00164,
  title  = {Measuring Large Language Models Capacity to Annotate Journalistic Sourcing},
  author = {Subramaniam Vincent and Phoebe Wang and Zhan Shi and Sahas Koka and Yi Fang},
  journal= {arXiv preprint arXiv:2501.00164},
  year   = {2025}
}