MediaSum:用于对话摘要的大规模媒体访谈数据集
计算与语言
2021-03-15 v2
摘要
MediaSum 是一个由 46.36 万条带抽取式摘要的转录文本组成的大规模媒体访谈数据集。为构建该数据集,我们收集了来自 NPR 和 CNN 的访谈转录文本,并将概述与主题描述用作摘要。相较于现有的公开对话摘要语料,我们的数据集规模大一个数量级,并包含来自多领域的复杂多方对话。我们开展统计分析以揭示电视与广播访谈转录文本中展现的独特位置偏置。我们还表明 MediaSum 可用于迁移学习,以提升模型在其他对话摘要任务上的表现。
引用
@article{arxiv.2103.06410,
title = {MediaSum: A Large-scale Media Interview Dataset for Dialogue Summarization},
author = {Chenguang Zhu and Yang Liu and Jie Mei and Michael Zeng},
journal= {arXiv preprint arXiv:2103.06410},
year = {2021}
}
备注
Dataset: https://github.com/zcgzcgzcg1/MediaSum/