基于词袋方法的古吉拉特语文本检索任务中不同索引技术的实验
信息检索
2024-09-05 v1 数字图书馆
摘要
本文给出了为改进古吉拉特语文本文档检索而开展的各项实验结果。文本检索涉及针对给定查询词集对文本文档进行搜索与排序。我们测试了多种采用词袋方法的检索模型。词袋方法是一种沿用至今的传统方法,将文本文档表示为词的集合。频率计数、逆文档频率等度量被用于标识并为用户查询排序相关文档。我们使用平均精度均值(metric of mean average precision)作为度量,采用不同排序模型来量化排序性能。古吉拉特语是一种形态丰富的语言,我们将停用词去除、词干提取和频繁形例生成等技术与基线进行比较,以衡量信息检索任务的改进。多数技术依赖于语言,需要开发特定语言工具。我们以未经处理的纯词索引作为基线,观察到应用不同索引技术后与基线相比MAP值有显著改善。
引用
@article{arxiv.2002.01792,
title = {Experiments with Different Indexing Techniques for Text Retrieval tasks on Gujarati Language using Bag of Words Approach},
author = {Jyoti Pareek and Hardik Joshi and Krunal Chauhan and Rushikesh Patel},
journal= {arXiv preprint arXiv:2002.01792},
year = {2024}
}