相关性何处涌现:基于内部注意力的零样态重排序的层级研究
信息检索
2026-04-28 v2
摘要
大语言模型(LLMs)的零样态文档重排序已从点排序方法演进为列表级和集合级方法,以优化计算效率。尽管这些方法取得了成功,但主要依赖生成式评分或输出 logits,面临推理延迟和结果一致性瓶颈。In-Context 重排序(ICR)最近提出作为 O(1) 的替代方法。ICR 直接提取内部注意力信号,避免文本生成的开销。然而,现有 ICR 方法仅简单地跨所有层聚合信号;层级贡献及其在不同架构中的一致性尚未得到探讨。此外,尚无统一研究将内部注意力与传统生成和似然机制在多样化排序框架下进行一致性比较。本文在多个排序框架中对生成、似然和内部注意力机制进行正交评估。我们进一步识别出相关信号在 transformer 各层之间呈现普遍的“钟形”分布,这激励我们提出的 Selective-ICR 策略,在不牺牲有效性的前提下将推理延迟降低 30%-50%。最后,针对推理密集型 BRIGHT 基准,精准捕获高质量 in-context 注意力信号从根本上减少了模型规模和强化学习的需求:一个零样态 8B 模型可匹配 14B 强化学习重排序器的性能,而 0.6B 模型甚至超越了最先进的生成方法。这些发现重新定义了 LLM 重排序的效率-效果边界,凸显了内部信号在复杂推理排序任务中的潜在价值。我们的代码和结果已公开于 https://github.com/ielab/Selective-ICR。
引用
@article{arxiv.2602.22591,
title = {Where Relevance Emerges: A Layer-Wise Study of Internal Attention for Zero-Shot Re-Ranking},
author = {Haodong Chen and Shengyao Zhuang and Zheng Yao and Guido Zuccon and Teerapong Leelanupab},
journal= {arXiv preprint arXiv:2602.22591},
year = {2026}
}
备注
Accepted by SIGIR 2026. 10 pages, 5 figures, 4 tables. Code available at https://github.com/ielab/Selective-ICR