中文

新闻文章中来源混合的解释

计算与语言 2024-11-11 v1 人工智能

摘要

人类作家会进行计划,然后编写。对于大型语言模型(LLMs)在更长篇幅的文章生成中发挥作用,我们必须理解人类在编写之前所做的计划步骤。我们探索了一种新闻报道中源选择作为评估长篇生成计划的案例研究。我们提出的问题是:为何特定的故事需要特定类型的来源?我们构想了一个故事编写的生成过程:首先由记者选择一种源选择方案,然后根据该方案中的类别选择来源。学习文章的计划意味着预测记者最初选择的方案。我们与专业记者合作,改编了五种现有方案并引入了三种新方案,以描述新闻稿中来源包含的计划。然后,受贝叶斯潜变量建模的启发,我们开发了指标来选择最可能的方案或方案,这些指标用于比较方案。我们发现两种方案:立场和社会归属感在大多数文档中最能解释源计划。然而,其他方案如文本蕴涵在“科学”等事实丰富的话题中解释源计划。最后,我们发现仅凭文章标题即可以合理精度预测最合适的方案。我们将此视为人类计划的重要案例研究,并为评估其他类型的计划提供了框架和方法。我们发布了一个语料库NewsSources,包含400万篇文章的注释。

关键词

引用

@article{arxiv.2411.05192,
  title  = {Explaining Mixtures of Sources in News Articles},
  author = {Alexander Spangher and James Youn and Matt DeButts and Nanyun Peng and Emilio Ferrara and Jonathan May},
  journal= {arXiv preprint arXiv:2411.05192},
  year   = {2024}
}

备注

9 pages