识别GPT模型用于相关性评估的提示词中的关键术语
信息检索
2024-05-14 v1
摘要
查询与段落之间的相关性评估是信息检索 (IR) 中的关键任务。近年来,大量研究针对使用大型语言模型 (LLM) 如GPT-4进行相关性判断相关任务展开,显示出显著的性能提升。然而,LLM的效能显著受到提示词设计的影响。本文旨在识别提示词中对LLM相关性评估具有正面或负面影响的具体术语。我们采用了两种类型的提示词:一种是来自前期研究的提示词,另一种是由LLM自动生成的提示词。通过比较这些提示词在few-shot和zero-shot设置下的性能,我们分析了提示词中特定术语的影响。我们的研究发现,两个主要发现。首先,我们发现使用“answer”这一术语的提示词比使用“relevant”这一术语的提示词更有效。这表明一种更直接的方法,即聚焦于回答查询,有助于提升性能。其次,我们注意到,对相关性范围的恰当平衡非常重要。虽然“relevant”这一术语可能会使范围过于宽泛,导致评估不够精确,但在定义相关性方面进行适当的平衡对于准确评估至关重要。通过提供更清晰的上下文,few-shot示例有助于更精确地定义这种平衡。鉴于“relevance”这一术语,few-shot示例有助于细化相关性标准。总之,我们的研究强调了在LLM相关性评估中,仔细选择提示词中的术语的重要性。
关键词
引用
@article{arxiv.2405.06931,
title = {Identifying Key Terms in Prompts for Relevance Evaluation with GPT Models},
author = {Jaekeol Choi},
journal= {arXiv preprint arXiv:2405.06931},
year = {2024}
}
备注
19pages, 2 figures