中文

UWBa 在 SemEval-2025 Task 7:多语言和跨语言事实核查索取

计算与语言 2025-08-14 v1

摘要

本文提出了一个零样本事实核查索取系统。我们使用了几种最先进的大语言模型获取文本嵌入。随后将这些模型组合以获得最佳结果。我们的方案在单语言子任务中获得第 7 名,在跨语言子任务中获得第 9 名。我们仅使用英文翻译作为文本嵌入模型的输入,因为多语言模型未取得满意的结果。我们通过利用嵌入和余弦相似度度量来识别每篇帖子最相关的主张。总体而言,NVIDIA NV-Embed-v2 模型获得了最佳结果。对于某些语言,我们从模型组合(NV-Embed 与 GPT 或 Mistral)中受益。

关键词

引用

@article{arxiv.2508.09517,
  title  = {UWBa at SemEval-2025 Task 7: Multilingual and Crosslingual Fact-Checked Claim Retrieval},
  author = {Ladislav Lenc and Daniel Cífka and Jiří Martínek and Jakub Šmíd and Pavel Král},
  journal= {arXiv preprint arXiv:2508.09517},
  year   = {2025}
}

备注

Published in Proceedings of the 19th International Workshop on Semantic Evaluation (SemEval-2025). Official version: https://aclanthology.org/2025.semeval-1.31/