基于模板的抽取式微博观点摘要
计算与语言
2022-10-05 v2 机器学习
摘要
我们提出微博观点摘要(MOS)任务,并分享一个包含3100条黄金标准观点摘要的数据集以推动该领域研究。该数据集包含跨越2年期间的推文摘要,涵盖的主题多于任何其他公开Twitter摘要数据集。摘要本质为生成式,由擅长按模板总结新闻文章的记者创建,模板将事实信息(主要故事)与作者观点分离。我们的方法与以往从社交媒体生成黄金标准摘要的工作不同,后者通常涉及筛选代表性帖子,因而偏向抽取式摘要模型。为展示该数据集的效用与挑战,我们对一系列生成式与抽取式最先进摘要模型进行基准测试,取得了良好性能,且前者优于后者。我们还表明微调对提升性能是必要的,并考察了使用不同样本量的益处。
引用
@article{arxiv.2208.04083,
title = {Template-based Abstractive Microblog Opinion Summarisation},
author = {Iman Munire Bilal and Bo Wang and Adam Tsakalidis and Dong Nguyen and Rob Procter and Maria Liakata},
journal= {arXiv preprint arXiv:2208.04083},
year = {2022}
}
备注
Accepted for publication in Transactions of the Association for Computational Linguistics (TACL), 2022. Pre-MIT Press publication version