中文

TIM:面向开放域时间线摘要的大规模数据集与大规模时间线智能模型

计算与语言 2025-06-30 v1 计算机与社会

摘要

开放域时间线摘要(TLS)对于追踪新闻主题的演变至关重要。为识别新闻主题的变化,现有方法通常采用通用大语言模型(LLMs)从检索到的新闻中总结相关时间戳。尽管通用大语言模型在零样本新闻摘要和时间戳定位方面表现出一定能力,但它们在评估主题相关性以及理解主题演变方面存在困难。因此,所总结的信息往往包含无关细节或时间戳不准确。为解决这些问题,我们提出了首个面向开放域 TLS 的大规模时间线智能模型(TIM),该模型能够有效地总结开放域时间线。具体而言,我们首先构建了一个大规模 TLS 数据集,包含超过 1,000 个新闻主题和 3,000 余条带标注的 TLS 实例。此外,我们提出了一种渐进式优化策略,逐步提升摘要性能。该策略采用指令微调来增强摘要生成和主题无关信息过滤能力;随后,利用一种新颖的双对齐奖励学习方法,从语义和时间两个视角进行对齐,从而提升对主题演变规律的理解。通过这种渐进式优化策略,TIM 展现出了强大的开放域时间线摘要能力。在开放域场景下的大量实验验证了我们 TIM 的有效性。

关键词

引用

@article{arxiv.2506.21616,
  title  = {TIM: A Large-Scale Dataset and large Timeline Intelligence Model for Open-domain Timeline Summarization},
  author = {Chuanrui Hu and Wei Hu and Penghang Yu and Hua Zhang and Bing-Kun Bao},
  journal= {arXiv preprint arXiv:2506.21616},
  year   = {2025}
}