中文

Jamp:用于评估语言模型泛化能力的受控日语时间推理数据集

计算与语言 2023-06-21 v1

摘要

涉及时间推理的自然语言推理(NLI)任务对预训练语言模型(LMs)而言仍具挑战。尽管已为该任务创建多种数据集,但它们主要关注英语,并未满足其他语言资源的需求。当前 LMs 是否实现了跨语言时间推理的泛化能力尚不清楚。本文中,我们提出 Jamp,一个聚焦于时间推理的日语 NLI 基准。我们的数据集涵盖一系列时间推理模式,从而支持细粒度分析。在启动数据标注流程时,我们基于形式语义测试套件创建多样的推理模板。随后,我们利用日语格框架词典与设计良好的模板自动生成多样的 NLI 样例,同时控制推理模式与金标签的分布。我们通过依据时态片段(即时间推理模式)划分数据集来评估单语/多语 LMs 的泛化能力。我们的发现表明,LMs 在特定语言现象(如习惯性)上表现吃力,说明跨语言更有效 NLI 模型的发展仍有空间。

关键词

引用

@article{arxiv.2306.10727,
  title  = {Jamp: Controlled Japanese Temporal Inference Dataset for Evaluating Generalization Capacity of Language Models},
  author = {Tomoki Sugimoto and Yasumasa Onoe and Hitomi Yanaka},
  journal= {arXiv preprint arXiv:2306.10727},
  year   = {2023}
}

备注

To appear in the Proceedings of the Association for Computational Linguistics: Student Research Workshop (ACL-SRW 2023)