中文

ESNLIR:一个包含因果关系的西班牙语多体裁数据集

计算与语言 2025-03-13 v1

摘要

自然语言推理(NLI),也称为识别文本蕴含(RTE),是自然语言处理(NLP)领域中的一个关键领域。该领域从根本上赋予机器辨别文本各部分之间语义关系的能力。尽管已经为英语执行了大量工作,但观察到针对西班牙语的努力相对稀少。基于此,本文专注于生成一个用于 NLI 的西班牙语多体裁数据集 ESNLIR,特别考虑了因果关系。一个初步基线已被构思并接受评估,利用了来自 BERT 家族的模型。研究结果表明,体裁的丰富化本质上促进了模型泛化能力的提升。本实验的代码、笔记本和完整数据集可在以下网址获取:https://zenodo.org/records/15002575。如果您仅对数据集感兴趣,可以在此处找到:https://zenodo.org/records/15002371。

关键词

引用

@article{arxiv.2503.08803,
  title  = {ESNLIR: A Spanish Multi-Genre Dataset with Causal Relationships},
  author = {Johan R. Portela and Nicolás Perez and Rubén Manrique},
  journal= {arXiv preprint arXiv:2503.08803},
  year   = {2025}
}