中文

SemEval-2024 任务 1:非洲与亚洲语言的语义文本相关性

计算与语言 2024-04-19 v5

摘要

我们介绍了首个关于语义文本相关性(STR)的共享任务。以往的共享任务主要关注语义相似性,而我们则研究了跨越 14 种语言的更广泛的语义相关性现象:南非荷兰语、阿尔及利亚阿拉伯语、阿姆哈拉语、英语、豪萨语、印地语、印度尼西亚语、卢旺达语、马拉地语、摩洛哥阿拉伯语、现代标准阿拉伯语、旁遮普语、西班牙语和泰卢固语。这些语言起源于五个不同的语系,主要在非洲和亚洲使用——这些地区的 NLP 资源相对有限。数据集中的每个实例都是一个句子对,关联着一个表示两个句子之间语义文本相关程度的分数。参与系统被要求在三个主要赛道中根据 14 种语言的句子对在意义上的接近程度(即语义相关程度)进行排序:有监督、无监督和跨语言。该任务吸引了 163 名参与者。我们共收到了来自 51 个不同团队的 70 份提交(涵盖所有任务),以及 38 篇系统描述论文。我们报告了表现最佳的系统以及三个不同赛道中最常见和最有效的方法。

关键词

引用

@article{arxiv.2403.18933,
  title  = {SemEval-2024 Task 1: Semantic Textual Relatedness for African and Asian Languages},
  author = {Nedjma Ousidhoum and Shamsuddeen Hassan Muhammad and Mohamed Abdalla and Idris Abdulmumin and Ibrahim Said Ahmad and Sanchit Ahuja and Alham Fikri Aji and Vladimir Araujo and Meriem Beloucif and Christine De Kock and Oumaima Hourrane and Manish Shrivastava and Thamar Solorio and Nirmal Surange and Krishnapriya Vishnubhotla and Seid Muhie Yimam and Saif M. Mohammad},
  journal= {arXiv preprint arXiv:2403.18933},
  year   = {2024}
}

备注

SemEval 2024 Task Description Paper. arXiv admin note: text overlap with arXiv:2402.08638