NLU-STR 在 SemEval-2024 任务 1:基于生成的增强与编码器的评分方法
计算与语言
2024-05-02 v1
摘要
语义文本相关性是语义相似性的更广泛概念。它衡量两个文本块在多大程度上传递相似的意义或主题,或共享相关概念或上下文。这种相关性可应用于各种应用程序,例如文档聚类和摘要生成。SemRel-2024 是 SemEval-2024 的共享任务,旨在通过提供包括阿拉伯语在内的十四种语言和方言的数据集来缩小语义相关性任务之间的差距。本文报告了我们在 Track A(阿尔及尔亚和摩洛哥方言)和 Track B(现代标准阿拉伯语)中的参赛情况。我们使用 BERT-based 模型进行回归评分进行监督式训练(Track A),而在非监督式 Track B 中采用 BERT-based 余弦相似度。我们的系统在 MSA 上获得了 0.49 的斯皮尔曼相关性得分,位列 SemRel-2024 第 1 名;在摩洛哥方言和阿尔及尔亚方言中分别位列第 5 和第 12 名,得分分别为 0.83 和 0.53。
引用
@article{arxiv.2405.00659,
title = {NLU-STR at SemEval-2024 Task 1: Generative-based Augmentation and Encoder-based Scoring for Semantic Textual Relatedness},
author = {Sanad Malaysha and Mustafa Jarrar and Mohammed Khalilia},
journal= {arXiv preprint arXiv:2405.00659},
year = {2024}
}