我们能使用大型语言模型填补相关性判定空缺吗?
信息检索
2024-05-10 v1 计算与语言
摘要
不完整的相关性判定限制了测试集的可重用性。当新系统与先前用于构建已判定文档池的系统进行比较时,由于测试集中的“空缺”(即新系统返回的未评估文档簇),它们往往处于劣势。在本文中,我们迈出了利用大型语言模型(LLM)扩展现有测试集的初步步伐,通过利用现有的人工判定作为基础来填补这些空缺。我们在使用 TREC iKAT 的对话搜索背景下探索了这一问题,其中信息需求高度动态,且响应(以及检索到的结果)更加多样化(留下更大的空缺)。尽管先前的工作表明 LLM 生成的自动判定能产生高度相关的排名,但我们发现,当同时使用人工判定和自动判定时,相关性显著降低(无论使用何种 LLM、单样本/双样本/少样本或微调)。我们进一步发现,根据所使用的 LLM 的不同,新运行结果会受到高度偏袒(或惩罚),并且这种效应与空缺的大小成正比地放大。相反,应在整个文档池上生成 LLM 标注,以获得与人工生成标签更一致的排名。未来的工作需要在提示工程和微调 LLM 方面展开,使其能够反映和代表人工标注,从而对模型进行基础化和对齐,使其更适合该目的。
引用
@article{arxiv.2405.05600,
title = {Can We Use Large Language Models to Fill Relevance Judgment Holes?},
author = {Zahra Abbasiantaeb and Chuan Meng and Leif Azzopardi and Mohammad Aliannejadi},
journal= {arXiv preprint arXiv:2405.05600},
year = {2024}
}