中文

批量自洽性提高LLM相关性评估与排序

信息检索 2025-09-23 v2

摘要

LLM查询-段落相关性评估通常采用逐个点评(pointwise, PW)策略,其中每个LLM调用仅评估一个段落。然而,这种策略需要调用次数等于段落数量,同时也阻止了段落之间信息共享。我们假设,批量PW方法(每次评估多个段落)不仅能提高效率,还能提高判断质量——通过使多个段落内容联合呈现。此外,批量PW方法可能更适合利用自洽性(self-consistency)的测试时扩展优势——即重复(可能扰动)LLM任务的并行处理并聚合结果的集合技术,因为批量处理可自然通过 varied batch permutations and compositions 来实现提示多样化,从而创建更稳健的集合。我们在三个段落检索数据集上,使用GPT-4o、Claude Sonnet 3和Amazon Nova Pro,对多种批量PW方法进行评估,以对比逐个PW和列表化排序基线。在相关性评估和排序任务中,我们显示,批量处理可显著放大自洽性效应,使批量PW方法在性能上最佳,同时通常将延迟缩短一个数量级以上。例如,在法律搜索中,使用GPT-4o的批量PW排序,置信度从1次自洽调用时的43.8%提升到51.3% NDCG@10,而逐个PW排序仅从44.9%提升到46.8%,且慢15.3倍。

关键词

引用

@article{arxiv.2505.12570,
  title  = {Batched Self-Consistency Improves LLM Relevance Assessment and Ranking},
  author = {Anton Korikov and Pan Du and Scott Sanner and Navid Rekabsaz},
  journal= {arXiv preprint arXiv:2505.12570},
  year   = {2025}
}