SemEval-2025 任务 7:基于优化向量维度的 TF-IDF 多语言事实核查主张检索
计算与语言
2025-05-20 v1
摘要
本文介绍了 Duluth 团队在 SemEval-2025 任务 7(多语言及跨语言事实核查主张检索)中的方法。我们实现了一个基于 TF-IDF 的检索系统,针对向量维度和分词策略进行实验。最佳配置使用词级分词,词汇表大小为 15,000 特征,在开发集上平均 success@10 为 0.78,在测试集上为 0.69,覆盖十个语言。我们的系统在高资源语言上表现更佳,但仍显著落后于排名第一的系统(平均 success@10 为 0.96)。我们的发现表明,尽管高级神经网络架构在多语言检索任务中日益占据主导地位,但经过充分优化的传统方法如 TF-IDF 仍是具有竞争力的基线,尤其在计算资源有限的场景下。
引用
@article{arxiv.2505.12616,
title = {Duluth at SemEval-2025 Task 7: TF-IDF with Optimized Vector Dimensions for Multilingual Fact-Checked Claim Retrieval},
author = {Shujauddin Syed and Ted Pedersen},
journal= {arXiv preprint arXiv:2505.12616},
year = {2025}
}
备注
SemEval-2025