中文

SemEval-2025 任务 7:基于优化向量维度的 TF-IDF 多语言事实核查主张检索

计算与语言 2025-05-20 v1

摘要

本文介绍了 Duluth 团队在 SemEval-2025 任务 7(多语言及跨语言事实核查主张检索)中的方法。我们实现了一个基于 TF-IDF 的检索系统,针对向量维度和分词策略进行实验。最佳配置使用词级分词,词汇表大小为 15,000 特征,在开发集上平均 success@10 为 0.78,在测试集上为 0.69,覆盖十个语言。我们的系统在高资源语言上表现更佳,但仍显著落后于排名第一的系统(平均 success@10 为 0.96)。我们的发现表明,尽管高级神经网络架构在多语言检索任务中日益占据主导地位,但经过充分优化的传统方法如 TF-IDF 仍是具有竞争力的基线,尤其在计算资源有限的场景下。

关键词

引用

@article{arxiv.2505.12616,
  title  = {Duluth at SemEval-2025 Task 7: TF-IDF with Optimized Vector Dimensions for Multilingual Fact-Checked Claim Retrieval},
  author = {Shujauddin Syed and Ted Pedersen},
  journal= {arXiv preprint arXiv:2505.12616},
  year   = {2025}
}

备注

SemEval-2025