OASum:大规模开放域基于方面的摘要生成
计算与语言
2023-05-29 v2
摘要
基于方面或基于查询的摘要生成近来受到更多关注,因为它能根据用户兴趣生成差异化的摘要。然而,当前用于基于方面或基于查询的摘要生成的数据集要么专注于特定领域,要么包含相对小规模的实例,要么仅包含少数几种方面类型。这些局限性阻碍了该方向的进一步探索。在本工作中,我们利用 Wikipedia.org 上的众包知识,自动创建了一个高质量、大规模的开放域基于方面的摘要生成数据集,名为 OASum,其中包含超过 370 万个实例,涵盖约 100 万个不同方面,涉及 200 万个维基百科页面。我们提供了 OASum 上的基准结果,并展示了其生成多样化基于方面的摘要的能力。为克服特定领域的数据稀缺问题,我们还在七个下游数据集上进行了零样本、少样本和微调实验。具体而言,零样本/少样本和微调结果表明,与骨干模型相比,在我们的语料库上预训练的模型展现出强大的基于方面或基于查询的生成能力。我们的数据集和预训练检查点已公开发布。
引用
@article{arxiv.2212.09233,
title = {OASum: Large-Scale Open Domain Aspect-based Summarization},
author = {Xianjun Yang and Kaiqiang Song and Sangwoo Cho and Xiaoyang Wang and Xiaoman Pan and Linda Petzold and Dong Yu},
journal= {arXiv preprint arXiv:2212.09233},
year = {2023}
}
备注
ACL 2023 Findings