中文

语言模型在学术检索中的低效性:一项实验性梳理

信息检索 2022-03-30 v1 计算与语言

摘要

语言模型在人工智能驱动的科学信息检索(IR)系统中日益流行。本文评估了流行的科学语言模型在处理(i)短查询文本和(ii)文本邻居方面的表现。我们的实验表明,即使在最宽松的条件下,模型也无法检索到与短查询文本相关的文档。此外,我们利用通过对原始文本进行微小扰动生成的文本邻居,证明并非所有扰动都会在嵌入空间中导致相近的邻居。进一步地,一项详尽的分类产生了若干正字法和语义相关、部分相关以及完全不相关的邻居类别。检索性能结果更多地受文本表层形式而非语义的影响。

关键词

引用

@article{arxiv.2203.15364,
  title  = {The Inefficiency of Language Models in Scholarly Retrieval: An Experimental Walk-through},
  author = {Shruti Singh and Mayank Singh},
  journal= {arXiv preprint arXiv:2203.15364},
  year   = {2022}
}

备注

21 pages. To appear in Findings of ACL 2022