改进大规模复述语料的获取与生成
计算与语言
2022-11-09 v3
摘要
本文针对现有基于 Twitter 的复述数据集中的质量问题,并讨论了在识别与生成任务中使用两种不同复述定义的必要性。我们提出一个新的 Twitter 多主题复述(MultiPIT)语料库,其包含总计 130k 个句子对,采用两种不同的复述定义进行复述识别,带有众包(MultiPIT_crowd)与专家(MultiPIT_expert)标注,此外还包括一个多参考测试集(MultiPIT_NMR)和一个用于复述生成的大规模自动构建训练集(MultiPIT_Auto)。借助提升的数据标注质量与任务特定的复述定义,在我们数据集上微调的最佳预训练语言模型取得了 84.2 F1 的自动复述识别最优性能。此外,我们的实证结果也表明,在 MultiPIT_Auto 上训练的复述生成模型相比在 Quora、MSCOCO 和 ParaNMT 等其他语料上微调的对应模型,生成了更多样且更高质量的复述。
引用
@article{arxiv.2210.03235,
title = {Improving Large-scale Paraphrase Acquisition and Generation},
author = {Yao Dou and Chao Jiang and Wei Xu},
journal= {arXiv preprint arXiv:2210.03235},
year = {2022}
}
备注
The project webpage is at http://twitter-paraphrase.com/ Accepted at EMNLP 2022