中文

大语言模型在社会科学研究数据发现中的关键词搜索性能比较

信息检索 2026-01-28 v1 应用统计

摘要

本文评估了基于大语言模型(LLM)的语义搜索工具相对于传统关键词搜索在数据发现方面的性能。使用真实的搜索行为,我们将应用于 UKRI 数据服务的定制语义搜索系统输出与消费数据研究中心(CDRC)关键词搜索进行比较。分析基于从 2023 年 12 月至 2024 年 10 月从 CDRC 搜索日志中提取的 131 个最常用搜索词。我们采用描述性统计、定性检查以及包括精确数据集重叠、Jaccard 相似度和由 BERT 嵌入导出的余弦相似度等定量相似度度量来评估返回数据集的数量、重叠度、排序和相关性。结果表明,语义搜索始终返回比关键词搜索更多的结果,并且在基于地点的、拼写错误、模糊或复杂查询方面表现尤为出色。尽管语义搜索未捕获所有基于关键词的结果,但返回的数据集绝大多数是语义上相似的,尽管精确重叠较低,余弦相似度分数很高。两种工具返回最相关结果的排序差异很大,反映出不同的优先级策略。案例研究表明,基于 LLM 的工具对拼写错误具有鲁棒性,能够有效解释地理和上下文相关性,并支持自然语言查询,而关键词搜索无法解决这些问题。总体而言,研究表明,LLM 驱动的语义搜索在数据发现方面提供了显著的改进,既可以补充而非完全取代传统的关键词方法。

关键词

引用

@article{arxiv.2601.19559,
  title  = {Comparing how Large Language Models perform against keyword-based searches for social science research data discovery},
  author = {Mark Green and Maura Halstead and Caroline Jay and Richard Kingston and Alex Singleton and David Topping},
  journal= {arXiv preprint arXiv:2601.19559},
  year   = {2026}
}