中文

NewsEdits 2.0:理解新闻更新背后的意图

计算机视觉与模式识别 2025-03-21 v5 机器学习

摘要

随着事件的发展,新闻文章通常会更新以包含新信息。如果不加注意,我们可能会传播过时的事实。在这项工作中,我们假设语言特征可以指示事实的流动性,并且我们可以仅使用新闻文章的文本(即不依赖搜索引擎等外部资源)来预测文章中的哪些事实会被更新。我们首先在大型新闻修订语料库中隔离事实更新来验证这一假设。新闻文章的更新可能出于多种原因(例如事实性、风格性或叙事性)。我们引入了NewsEdits 2.0,一个编辑意图分类体系,用于区分新闻写作中的事实更新与风格和叙事更新。我们标注了超过9,200对句子修订,并训练了高性能的集成模型来应用这一分类体系。然后,利用一个大型的带噪声标签数据集,我们展示了我们的方法能够以高精度预测文章中的事实何时会被更新。最后,为了展示这些发现的实际用途,我们构建了一个语言模型问答(LLM-QA)弃权任务。我们希望LLM在信息可能过时时避免回答。利用我们的预测,LLM的弃权准确率达到了接近oracle的水平。

关键词

引用

@article{arxiv.2411.18810,
  title  = {All Seeds Are Not Equal: Enhancing Compositional Text-to-Image Generation with Reliable Random Seeds},
  author = {Shuangqi Li and Hieu Le and Jingyi Xu and Mathieu Salzmann},
  journal= {arXiv preprint arXiv:2411.18810},
  year   = {2025}
}