斯洡语义文本相似性方法综述:从算法到 Transformer
计算与语言
2026-02-05 v1
摘要
语义文本相似性(STS) 在众多自然语言处理任务中发挥着关键作用. 尽管在高资源语言中得到广泛研究,但对于斯洡这样的低资源语言来说,STS 仍面临挑战. 本文对用于斯洡语的句子级 STS 方法进行比较评估,包括传统算法、监督机器学习模型和第三方深度学习工具. 我们使用来自传统算法的输出作为特征训练了多个机器学习模型,并通过人工蜂群优化进行特征选择和超参数调优. 最后,我们评估了多个第三方工具,包括 CloudNLP 微调模型、OpenAI 的嵌入模型、GPT-4 模型以及预训练的斯洡 BERT 模型. 我们的发现揭示了不同方法之间的权衡.
关键词
引用
@article{arxiv.2602.04659,
title = {Approaches to Semantic Textual Similarity in Slovak Language: From Algorithms to Transformers},
author = {Lukas Radosky and Miroslav Blstak and Matej Krajcovic and Ivan Polasek},
journal= {arXiv preprint arXiv:2602.04659},
year = {2026}
}
备注
This is a preprint of a paper that was presented at the IEEE 24th World Symposium on Applied Machine Intelligence and Informatics (SAMI 2026)