EveTAR:构建大规模多任务阿拉伯语推文测试集
信息检索
2017-08-22 v2
摘要
本文介绍了一种独立于语言的新方法,用于创建支持多种信息检索(IR)任务的大规模高质量推文测试集,而无需举办共享任务评测活动。所采用的方法(在阿拉伯语推文上进行了演示)围绕重大(即热门)事件设计测试集,这使得能够开发代表 Twitter 用户频繁信息需求且存在丰富内容的主题。这固有地促进了对通常围绕事件的多种任务的支持,即事件检测、即席搜索、时间线生成和实时摘要。该方法的关键亮点包括:通过交互式搜索和每个主题多个手工编制的查询来多样化评判池,通过众包工作者收集高质量的相关性标注并通过内部标注员收集新颖性标注,过滤低一致性主题和无法访问的推文,以及提供测试集的多个子集以获得更好的可用性。将我们的方法应用于阿拉伯语推文,产生了 EveTAR,这是第一个免费可用的面向多种 IR 任务的推文测试集。EveTAR 包含 3.55 亿条阿拉伯语推文的爬取数据,并覆盖了 50 个重大事件,其中约 6.2 万条推文经过评判,具有较高的平均标注员间一致性(Kappa 值为 0.71)。我们通过评估各任务中的现有算法来证明 EveTAR 的可用性。结果表明,新的测试集能够支持对 IR 系统进行可靠的排名,其可比性类似于 TREC 测试集,同时为未来针对阿拉伯语推文的研究提供了强大的基线结果。
引用
@article{arxiv.1708.05517,
title = {EveTAR: Building a Large-Scale Multi-Task Test Collection over Arabic Tweets},
author = {Maram Hasanain and Reem Suwaileh and Tamer Elsayed and Mucahid Kutlu and Hind Almerekhi},
journal= {arXiv preprint arXiv:1708.05517},
year = {2017}
}