中文

利用自监督方法增强抽象式对话摘要的语义理解

计算与语言 2022-09-02 v1 人工智能

摘要

上下文词嵌入能够在自然语言理解中带来最先进的性能。近来,诸如 BERT 之类的预训练深度上下文文本编码器已展现出其在改进包括抽象式摘要在内的自然语言任务方面的潜力。现有的对话摘要方法侧重于将大型语言模型引入到基于由新闻文章而非多说话人对话组成的大规模语料训练的摘要任务中。本文中,我们引入自监督方法来弥补训练对话摘要模型的不足。我们的原则是利用 pretext 对话文本检测不连贯的信息流,以增强 BERT 对对话文本表征进行上下文建模的能力。我们基于增强的 BERT,在共享编码器-解码器架构上构建并微调了一个抽象式对话摘要模型。我们使用 SAMSum 语料库(一个近期推出的带有抽象式对话摘要的数据集)对我们的抽象式对话摘要器进行了实证评估。我们所有的方法都提升了以 ROUGE 分数衡量的抽象式摘要效果。通过广泛的消融研究,我们还对关键模型超参数、切换话语的概率以及掩蔽对话者进行了敏感性分析。

关键词

引用

@article{arxiv.2209.00278,
  title  = {Enhancing Semantic Understanding with Self-supervised Methods for Abstractive Dialogue Summarization},
  author = {Hyunjae Lee and Jaewoong Yun and Hyunjin Choi and Seongho Joe and Youngjune L. Gwon},
  journal= {arXiv preprint arXiv:2209.00278},
  year   = {2022}
}

备注

5 pages, 3 figures, INTERSPEECH 2021