AlignSum:用于对齐人类摘要偏好的数据金字塔分层微调
计算与语言
2024-10-02 v1
摘要
文本摘要任务通常采用预训练语言模型(PLM)来拟合各种标准数据集。虽然这些PLM在自动评估中表现出色,但它们在人工评估中常常表现不佳,这表明它们生成的摘要与人类摘要偏好之间存在偏差。这种差异很可能是由于微调数据集质量低,以及反映真实人类偏好的高质量人工标注数据有限所致。为了应对这一挑战,我们引入了一个新颖的人类摘要偏好对齐框架AlignSum。该框架由三部分组成:首先,我们构建了一个包含抽取式、生成式和人工标注摘要数据的数据金字塔。其次,我们进行高斯重采样以去除长度极端的摘要。最后,我们在高斯重采样后的数据金字塔上实施两阶段分层微调。我们在人工标注的CNN/DailyMail和BBC XSum数据集上将AlignSum应用于PLM。实验表明,使用AlignSum后,像BART-Large这样的PLM在自动评估和人工评估中均超越了175B的GPT-3。这表明AlignSum显著增强了语言模型与人类摘要偏好的对齐。
引用
@article{arxiv.2410.00409,
title = {AlignSum: Data Pyramid Hierarchical Fine-tuning for Aligning with Human Summarization Preference},
author = {Yang Han and Yiming Wang and Rui Wang and Lu Chen and Kai Yu},
journal= {arXiv preprint arXiv:2410.00409},
year = {2024}
}
备注
EMNLP2024 Findings, code at: https://github.com/csyanghan/AlignSum