中文

强化语义对称性用于文档摘要

计算与语言 2022-04-01 v3

摘要

文档摘要将长文档压缩为包含显著信息和准确语义描述的短版本。主要问题是如何使输出摘要与输入文档在语义上一致。为实现这一目标,近期研究者聚焦于有监督的端到端混合方法,其包含抽取模块和生成模块。其中,抽取器从输入文档中识别显著句子,生成器从显著句子生成摘要。该模型通过各种策略(如强化学习)成功保持了生成摘要与参考摘要间的一致性。训练混合模型时存在两个语义鸿沟(一个是文档与抽取句子之间,另一个是抽取句子与摘要之间)。然而,现有方法未显式考虑它们,通常导致摘要的语义偏差。为缓解上述问题,本文提出一种用于文档摘要的新的强化语义对称性学习模型(ReSyM)。ReSyM 在抽取器中引入语义一致性奖励以弥合第一个鸿沟;设计语义对偶奖励以弥合生成器中的第二个鸿沟。整个文档摘要过程通过带混合奖励机制(结合上述两种奖励)的强化学习实现。此外,提出一种全面的句子表示学习方法以充分捕获原始文档中的信息。在 CNN/Daily Mail 和 BigPatent 两个广泛使用的基准数据集上进行了一系列实验。结果表明,在各项评估指标上,与最先进的基线相比,ReSyM 具有优越性。

关键词

引用

@article{arxiv.2112.07583,
  title  = {Reinforcing Semantic-Symmetry for Document Summarization},
  author = {Mingyang Song and Liping Jing},
  journal= {arXiv preprint arXiv:2112.07583},
  year   = {2022}
}

备注

content revising