自编码器作为辅助监督器:改进中文社交媒体文本摘要中的文本表示
计算与语言
2018-05-15 v1
摘要
当前大多数抽取式文本摘要模型基于序列到序列模型(Seq2Seq)。社交媒体的源内容长且含噪声,因此 Seq2Seq 难以学习准确的语义表示。与源内容相比,标注摘要简短且书写规范,并与源内容含义相同。在本文中,我们以摘要的表示来监督源内容表示的学习。在实现上,我们将摘要自编码器视为 Seq2Seq 的辅助监督器。遵循先前工作,我们在一个流行的中文社交媒体数据集上评估我们的模型。实验结果表明,我们的模型在该基准数据集上取得了最先进的性能。
引用
@article{arxiv.1805.04869,
title = {Autoencoder as Assistant Supervisor: Improving Text Representation for Chinese Social Media Text Summarization},
author = {Shuming Ma and Xu Sun and Junyang Lin and Houfeng Wang},
journal= {arXiv preprint arXiv:1805.04869},
year = {2018}
}
备注
accepted by ACL 2018