DialogLM:用于长对话理解与摘要的预训练模型
计算与语言
2022-01-07 v2
摘要
对话是人类沟通与合作的基本方式。现有研究主要聚焦于一对一的短对话场景。然而,现实世界中的多人交互(如会议或访谈)经常长达数千词。目前仍缺乏相应的研究及强有力的工具来理解和处理此类长对话。因此,本工作中我们提出了一种用于长对话理解与摘要的预训练框架。考虑到长对话的性质,我们提出了一种基于窗口的去噪方法用于生成式预训练。对于一段对话,该方法用对话启发的噪声破坏一个文本窗口,并引导模型基于剩余对话内容重建该窗口。此外,为处理更长输入,我们以混合方式将模型增强以稀疏注意力,并与常规注意力结合。我们在五个长对话数据集上进行了广泛实验,涵盖对话摘要、抽取式问答和话题分割任务。实验上,我们表明我们的预训练模型DialogLM在跨数据集和任务上显著超越SOTA模型。源代码与所有预训练模型已发布于我们的GitHub仓库(https://github.com/microsoft/DialogLM)。
引用
@article{arxiv.2109.02492,
title = {DialogLM: Pre-trained Model for Long Dialogue Understanding and Summarization},
author = {Ming Zhong and Yang Liu and Yichong Xu and Chenguang Zhu and Michael Zeng},
journal= {arXiv preprint arXiv:2109.02492},
year = {2022}
}
备注
Accepted by AAAI 2022