中文

OasisSimp: 开源亚洲-英语句子简化数据集

计算与语言 2026-03-17 v1

摘要

句子简化旨在通过降低语言复杂度来提高文本可访问性, 同时保持原意。然而, 在中资源和低资源语言领域, 此类研究进展受限于数据稀缺。为填补这一空白, 本文介绍 OasisSimp 数据集, 这是一个覆盖五种语言的多语言句子简化数据集: 英文、斯里兰卡语、泰米尔语、普什图语和泰语。其中, 泰语、普什图语和泰米尔语尚无先前的句子简化数据集, 斯里兰卡语的数据亦有限。每个语言的简化数据集均由经过训练的标注员按照详细指南创建, 这些指南要求标注员在保持意义、流畅性和语法正确性的前提下简化句子。我们在 OasisSimp 数据集上评估了八个开放权重的多语言大型语言模型(LLM), 发现高资源语言和低资源语言之间存在显著的性能差异, 这凸显了多语言环境下的简化挑战。OasisSimp 数据集因此提供了宝贵的多语言资源和具备挑战性的基准, 揭示了当前 LLM-based 简化方法的局限性, 为低资源句子简化的未来研究指明了方向。数据集可在 https://OasisSimpDataset.github.io/ 上获取。

关键词

引用

@article{arxiv.2603.14111,
  title  = {OasisSimp: An Open-source Asian-English Sentence Simplification Dataset},
  author = {Hannah Liu and Muxin Tian and Iqra Ali and Haonan Gao and Qiaoyiwen Wu and Blair Yang and Uthayasanker Thayasivam and En-Shiun Annie Lee and Pakawat Nakwijit and Surangika Ranathunga and Ravi Shekhar},
  journal= {arXiv preprint arXiv:2603.14111},
  year   = {2026}
}

备注

Accepted at LREC 2026