LongEval 中的 DS@GT:基于两阶段检索评估 Web 搜索系统的时序性能
信息检索
2025-07-14 v1
摘要
信息检索(IR)模型通常在静态数据集上进行训练,这使得它们在 web 内容演化后容易出现性能下降。DS@GT 竞赛团队参与了 CLEF 2025 中的 Longitudinal Evaluation of Model Performance(LongEval)实验室,该实验室评估跨时序分布的 web 快照中的 IR 系统。我们对 Qwant web 数据集进行分析,包括关于时间轴上主题建模的探索性数据分析。两阶段检索系统采用稀疏关键词搜索,利用查询扩展和文档重新排序。我们的最佳系统在整个训练和测试数据集上实现了 0.296 的平均 NDCG@10,在 2023-05 的总体最佳得分为 0.395。本文随附的代码位于 https://github.com/dsgt-arc/longeval-2025
引用
@article{arxiv.2507.08360,
title = {DS@GT at LongEval: Evaluating Temporal Performance in Web Search Systems and Topics with Two-Stage Retrieval},
author = {Anthony Miyaguchi and Imran Afrulbasha and Aleksandar Pramov},
journal= {arXiv preprint arXiv:2507.08360},
year = {2025}
}