中文

基于模板的抽取式微博观点摘要

计算与语言 2022-10-05 v2 机器学习

摘要

我们提出微博观点摘要(MOS)任务,并分享一个包含3100条黄金标准观点摘要的数据集以推动该领域研究。该数据集包含跨越2年期间的推文摘要,涵盖的主题多于任何其他公开Twitter摘要数据集。摘要本质为生成式,由擅长按模板总结新闻文章的记者创建,模板将事实信息(主要故事)与作者观点分离。我们的方法与以往从社交媒体生成黄金标准摘要的工作不同,后者通常涉及筛选代表性帖子,因而偏向抽取式摘要模型。为展示该数据集的效用与挑战,我们对一系列生成式与抽取式最先进摘要模型进行基准测试,取得了良好性能,且前者优于后者。我们还表明微调对提升性能是必要的,并考察了使用不同样本量的益处。

关键词

引用

@article{arxiv.2208.04083,
  title  = {Template-based Abstractive Microblog Opinion Summarisation},
  author = {Iman Munire Bilal and Bo Wang and Adam Tsakalidis and Dong Nguyen and Rob Procter and Maria Liakata},
  journal= {arXiv preprint arXiv:2208.04083},
  year   = {2022}
}

备注

Accepted for publication in Transactions of the Association for Computational Linguistics (TACL), 2022. Pre-MIT Press publication version