German4All——面向德语的可读性控制 paraphrase 数据集与模型
计算与语言
2025-09-01 v2
摘要
在不同难度水平上对文本进行 paraphrase 以创建可访问文本,使其能够针对不同读者群体进行定制,是至关重要的。因此,我们引入 German4All,这是第一个大规模德语可读性控制、段落级 aligned paraphrase 数据集。该数据集覆盖五个可读性水平,包含超过 25,000 个样本。该数据集通过 GPT-4 自动合成,并通过人类和 LLM 基于判断进行严格评估。使用 German4All,我们训练了一个开源的、可读性控制的 paraphrase 模型,在德语文本简化方面实现了最先进的性能,使其能够进行更细致的、针对特定读者的定制。我们开源了数据集和模型,以鼓励进一步的多层次 paraphrase 研究。
引用
@article{arxiv.2508.17973,
title = {German4All -- A Dataset and Model for Readability-Controlled Paraphrasing in German},
author = {Miriam Anschütz and Thanh Mai Pham and Eslam Nasrallah and Maximilian Müller and Cristian-George Craciun and Georg Groh},
journal= {arXiv preprint arXiv:2508.17973},
year = {2025}
}
备注
Accepted to INLG 2025