中文

构建 Tetun Ad-Hoc 文本检索的基础:词干提取、索引、检索与排序

信息检索 2025-10-16 v6

摘要

在互联网和数字平台上搜索信息需要有效的检索解决方案。然而,Tetun 语尚无此类解决方案,导致难以针对该语言的搜索查询找到相关文档。为填补这一空白,本文研究 Tetun 语文本检索,重点关注 ad-hoc 检索任务。本研究首先开发了基础语言资源——包括停用词表、词干提取器和测试集——作为 Tetun 文本检索的基础。使用文档标题和内容评估了多种策略。结果表明,在去除连字符和撇号但不进行词干提取的情况下检索文档标题,性能优于基线。效率提升了 31.37%,在使用 DFR BM25 时,MAP@10 平均相对提升 +9.40%,NDCG@10 提升 +30.35%。在 top-10 截断点之后,Hiemstra LM 在多种检索策略和评估指标中表现出色。本工作的贡献包括开发 Labadain-Stopwords(包含 160 个 Tetun 停用词的列表)、Labadain-Stemmer(具有三种变体的 Tetun 词干提取器)和 Labadain-Avaliad'or(包含 59 个主题、33,550 篇文档和 5,900 个 qrels 的 Tetun 测试集)。这些资源已公开发布,以支持未来的 Tetun 信息检索研究。

关键词

引用

@article{arxiv.2412.11758,
  title  = {Establishing a Foundation for Tetun Ad-Hoc Text Retrieval: Stemming, Indexing, Retrieval, and Ranking},
  author = {Gabriel de Jesus and Sérgio Nunes},
  journal= {arXiv preprint arXiv:2412.11758},
  year   = {2025}
}

备注

Pre-print version