中文

VTechAGP:学术到大众受众文本改写数据集与基准模型

计算与语言 2025-02-25 v2 数字图书馆 机器学习

摘要

现有的文本简化或改写数据集主要关注通用领域的句子级文本生成。这些数据集通常在不使用领域知识的情况下开发。在本文中,我们发布了一个新颖的数据集VTechAGP,这是首个学术到大众受众文本改写数据集,由8所大学在25年间撰写的论文和学位论文的学术摘要与大众受众摘要配对组成。我们还提出了一种新颖的动态软提示生成语言模型DSPT5。在训练中,我们利用对比生成损失函数来学习动态提示中的关键词向量。在推理中,我们在语义和结构两个层面采用群体采样解码策略来进一步选择最佳输出候选。我们从多个角度评估了DSPT5和各种最先进的大语言模型(LLMs)。结果表明SOTA大语言模型未能提供令人满意的结果,而轻量级的DSPT5可以达到具有竞争力的结果。据我们所知,我们是第一个为学术到大众受众文本改写数据集构建基准数据集和解决方案的。模型将在接受后公开。

关键词

引用

@article{arxiv.2411.04825,
  title  = {VTechAGP: An Academic-to-General-Audience Text Paraphrase Dataset and Benchmark Models},
  author = {Ming Cheng and Jiaying Gong and Chenhan Yuan and William A. Ingram and Edward Fox and Hoda Eldardiry},
  journal= {arXiv preprint arXiv:2411.04825},
  year   = {2025}
}

备注

21 pages, 3 figures, accepted for publication in NAACL 2025 Main Conference