ParaAMR:基于 AMR 回译的大规模句法多样复述数据集
计算与语言
2023-05-29 v1
摘要
复述生成是自然语言处理(NLP)中的一项长期任务。有监督复述生成模型依赖人工标注的复述对,成本高且难以扩展。另一方面,自动标注的复述对(例如通过机器回译)通常缺乏句法多样性——生成的复述句在句法上与源句非常相似。在本工作中,我们提出 ParaAMR,一个通过抽象语义表示(abstract meaning representation,AMR)回译创建的大规模句法多样复述数据集。我们的定量分析、定性示例和人工评估表明,与现有大规模复述数据集相比,ParaAMR 的复述在句法上更具多样性,同时保持良好的语义相似度。此外,我们展示了 ParaAMR 可用于改进三项 NLP 任务:学习句子嵌入、句法可控复述生成以及少样本学习的数据增强。因此,我们的结果展示了 ParaAMR 在改进各种 NLP 应用方面的潜力。
引用
@article{arxiv.2305.16585,
title = {ParaAMR: A Large-Scale Syntactically Diverse Paraphrase Dataset by AMR Back-Translation},
author = {Kuan-Hao Huang and Varun Iyer and I-Hung Hsu and Anoop Kumar and Kai-Wei Chang and Aram Galstyan},
journal= {arXiv preprint arXiv:2305.16585},
year = {2023}
}
备注
ACL 2023