中文

PESTS:用于语义文本相似度的波斯语-英语跨语言语料库

计算与语言 2024-09-06 v3 人工智能

摘要

自然语言处理中近期受到大量研究的组成部分之一是语义文本相似度。在计算语言学和自然语言处理中,评估词、短语、段落和文本的语义相似度至关重要。计算两个文本片段、段落或短语在单语和跨语言版本下提供的语义相似程度被称为语义相似度。跨语言语义相似度需要这样的语料库:其中存在源语言与目标语言双方的句子对,且它们之间具有某种程度的语义相似度。许多现有跨语言语义相似度模型由于缺少跨语言语义相似度数据集而使用机器翻译,机器翻译错误的传播降低了模型的准确率。另一方面,当我们要将语义相似度特征用于机器翻译时,不应将相同的机器翻译用于语义相似度。对于波斯语这一低资源语言之一,此前尚无相关努力,且比以往更迫切需要一个能理解两种语言上下文的模型。本文中,首次通过使用语言学专家生成了波斯语与英语句子间的语义文本相似度语料库。我们将该数据集命名为PESTS(Persian English Semantic Textual Similarity,波斯语-英语语义文本相似度)。该语料库包含5375个句子对。此外,基于Transformer的不同模型已使用该数据集进行了微调。结果表明,使用PESTS数据集,XLM ROBERTa模型的皮尔逊相关系数从85.87%提升至95.62%。

关键词

引用

@article{arxiv.2305.07893,
  title  = {PESTS: Persian_English Cross Lingual Corpus for Semantic Textual Similarity},
  author = {Mohammad Abdous and Poorya Piroozfar and Behrouz Minaei Bidgoli},
  journal= {arXiv preprint arXiv:2305.07893},
  year   = {2024}
}