利用表示偏差进行抽象文本摘要的数据蒸馏
计算与语言
2023-12-21 v2
摘要
抽象文本摘要随着训练样本数量的增加而蓬勃发展,以满足深度学习模型的需求。这些模型倾向于利用训练数据表示,通过改进生成摘要的量化元素来获得优越性能。然而,增加训练集的大小并不总是最大化性能的理想解决方案,因此,必须重新审视训练样本的质量和深度学习模型的学习协议。在本文中,我们旨在离散化抽象文本摘要模型的向量空间,以理解输入嵌入空间与模型编码器空间之间学习到的特征。我们表明,深度模型未能捕捉输入空间的多样性。此外,编码器空间上数据点的分布表明,不加控制地增加训练样本并无价值;相反,非常需要精简数据样本,以使模型关注多样性和忠实度。我们采用聚类技术来学习模型样本空间的多样性,以及数据点如何从嵌入空间映射到编码器空间,反之亦然。此外,我们设计了一个度量来过滤冗余数据点,使模型更鲁棒且更少数据依赖。我们使用定量指标(如Rouge)和定性指标(如BERTScore、FEQA和Pyramid分数)对我们的方法进行基准测试。我们还量化了阻碍模型从多样输入样本中学习多样性的原因。
引用
@article{arxiv.2312.06022,
title = {Exploiting Representation Bias for Data Distillation in Abstractive Text Summarization},
author = {Yash Kumar Atri and Vikram Goyal and Tanmoy Chakraborty},
journal= {arXiv preprint arXiv:2312.06022},
year = {2023}
}