改进行列式点过程的相似度度量以用于抽取式多文档摘要
计算与语言
2019-06-04 v1
摘要
多文档摘要面临的最重要障碍包括源描述中过度的冗余以及训练数据的日益短缺。这些障碍阻碍了 encoder-decoder 模型的直接使用,但已知基于优化的方法如行列式点过程(DPPs)能很好地应对它们。在本文中,我们旨在通过提出一种受胶囊网络启发的新型相似度度量,来加强基于 DPP 的抽取式多文档摘要方法。该方法基于表层形式与语义信息衡量一对句子间的冗余。我们表明,具有改进相似度度量的 DPP 系统表现具竞争力,在基准数据集上优于强摘要基线。我们的发现对摘要由多位作者创作、包含冗余但词汇多样表述的文档尤其有意义。
引用
@article{arxiv.1906.00072,
title = {Improving the Similarity Measure of Determinantal Point Processes for Extractive Multi-Document Summarization},
author = {Sangwoo Cho and Logan Lebanoff and Hassan Foroosh and Fei Liu},
journal= {arXiv preprint arXiv:1906.00072},
year = {2019}
}
备注
ACL 2019 (Long Paper)