数据集检索会话的特征:来自真实数字图书馆的经验
数字图书馆
2020-10-13 v2 信息检索
摘要
二次分析或现有调查数据的复用是社会科学家中的常见做法。在该群体中,在数字图书馆中搜索相关数据集在某种程度上是一种陌生行为。数据集检索,尤其是社会科学中的数据集检索,还包含诸如代码簿、问卷、原始数据文件等额外材料。我们的假设是,由于数据集的多样性,文档检索模型在检索数据集时往往效率不高。增强此类搜索的一种方式是引入用户交互上下文,以个性化数据集检索会话。作为这一长期目标的第一步,我们研究了来自一个同时包含研究数据与出版物的真实社会科学数字图书馆的数据集检索会话特征。先前研究提出了通过查询长度区分文档搜索与数据集搜索的方法。在本文中,我们质疑该论断,并报告了无论目标是数据集还是文档,查询均不可区分的发现。此外,我们针对 65,000 个独特会话,报告了关于查询特征、交互序列以及主题漂移方面的数据集检索会话发现。
引用
@article{arxiv.2006.02770,
title = {Characteristics of Dataset Retrieval Sessions: Experiences from a Real-life Digital Library},
author = {Zeljko Carevic and Dwaipayan Roy and Philipp Mayr},
journal= {arXiv preprint arXiv:2006.02770},
year = {2020}
}
备注
Accepted for publication at TPDL 2020