中文

SemRel2024:面向 13 种语言的语义文本相关性数据集集合

计算与语言 2024-06-03 v5

摘要

探索和量化语义相关性是表示语言的核心,对各种 NLP 任务具有重要意义。早期的 NLP 研究主要集中在语义相似性上,通常在英语语境下进行,而我们则研究语义相关性这一更广泛的现象。在本文中,我们提出了 \textit{SemRel},一个由母语使用者跨 13 种语言标注的新语义相关性数据集集合:\textit{南非荷兰语、阿尔及利亚阿拉伯语、阿姆哈拉语、英语、豪萨语、印地语、印尼语、卢旺达语、马拉地语、摩洛哥阿拉伯语、现代标准阿拉伯语、西班牙语}和\textit{泰卢固语}。这些语言起源于五个不同的语系,主要在非洲和亚洲使用——这些地区的 NLP 资源可用性相对有限。SemRel 数据集中的每个实例都是一对句子,并带有一个分数,表示两个句子之间语义文本相关性的程度。这些分数是通过比较标注框架获得的。我们描述了数据收集和标注过程、构建数据集时的挑战、基线实验及其在 NLP 中的影响和效用。

关键词

引用

@article{arxiv.2402.08638,
  title  = {SemRel2024: A Collection of Semantic Textual Relatedness Datasets for 13 Languages},
  author = {Nedjma Ousidhoum and Shamsuddeen Hassan Muhammad and Mohamed Abdalla and Idris Abdulmumin and Ibrahim Said Ahmad and Sanchit Ahuja and Alham Fikri Aji and Vladimir Araujo and Abinew Ali Ayele and Pavan Baswani and Meriem Beloucif and Chris Biemann and Sofia Bourhim and Christine De Kock and Genet Shanko Dekebo and Oumaima Hourrane and Gopichand Kanumolu and Lokesh Madasu and Samuel Rutunda and Manish Shrivastava and Thamar Solorio and Nirmal Surange and Hailegnaw Getaneh Tilaye and Krishnapriya Vishnubhotla and Genta Winata and Seid Muhie Yimam and Saif M. Mohammad},
  journal= {arXiv preprint arXiv:2402.08638},
  year   = {2024}
}

备注

Accepted to the Findings of ACL 2024