波兰语自然语言推理与事实性——基于专家的数据集与基准
计算与语言
2023-06-21 v1 机器学习
摘要
尽管机器学习在自然语言处理方面取得了近期突破,自然语言推理(NLI)问题仍构成挑战。为此,我们贡献了一个专注于事实性现象的新数据集;然而,我们的任务与其他 NLI 任务相同,即预测蕴含、矛盾或中立(ECN)。该数据集包含完全自然的波兰语话语,收集了 2,432 个动词-补语对和 309 个唯一动词。数据集基于波兰国家语料库(NKJP),且在主要动词频率及其他语言特征(如内部否定的出现)方面具有代表性样本。我们发现基于 transformer BERT 的模型在句子上取得了相对良好的结果(约 89% F1 分数)。尽管使用语言特征取得了更好结果(约 91% F1 分数),该模型需要更多人力(humans in the loop),因为特征由专家语言学家手动准备。仅消费输入句子的基于 BERT 的模型表明其捕获了 NLI/事实性的大部分复杂性。该现象中的复杂情形——例如具有蕴含(E)与非事实动词的情形——仍是待进一步研究的开放问题。
引用
@article{arxiv.2201.03521,
title = {Polish Natural Language Inference and Factivity -- an Expert-based Dataset and Benchmarks},
author = {Daniel Ziembicki and Anna Wróblewska and Karolina Seweryn},
journal= {arXiv preprint arXiv:2201.03521},
year = {2023}
}