中文

ParaFusion:一种大规模LLM驱动的英语释义数据集,融合高质量词汇与句法多样性

计算与语言 2024-04-19 v1 人工智能 机器学习

摘要

释义生成是自然语言处理(NLP)中的关键任务。现有数据集缺乏句法和词汇多样性,导致生成的释义与源句子高度相似。此外,这些数据集常包含仇恨言论和噪声,并可能无意中包含非英语句子。本研究提出ParaFusion,一种利用大型语言模型(LLM)开发的大规模高质量英语释义数据集,以应对这些挑战。ParaFusion通过高质量数据扩充现有数据集,在保持紧密语义相似性的同时显著提升词汇和句法多样性。它还减少了仇恨言论和噪声,确保数据集更清洁、更聚焦于英语。结果表明,ParaFusion在句法和词汇多样性上至少提升25%(基于每个数据源的多个指标衡量)。本文还旨在为释义评估设定黄金标准,因其包含了迄今为止最全面的评估策略之一。结果凸显了ParaFusion作为改进NLP应用的宝贵资源的潜力。

关键词

引用

@article{arxiv.2404.12010,
  title  = {ParaFusion: A Large-Scale LLM-Driven English Paraphrase Dataset Infused with High-Quality Lexical and Syntactic Diversity},
  author = {Lasal Jayawardena and Prasan Yapa},
  journal= {arXiv preprint arXiv:2404.12010},
  year   = {2024}
}