中文

重新审视文档排序中的推理:为何思维链表现不佳

信息检索 2025-10-13 v1

摘要

文档重排序是信息检索(IR)中的关键组件,旨在优化初始检索结果,以提升下游任务的排序质量。受大型推理模型(LRMs)的启发,近期研究开始在基于 LLM 的重排序器中引入显式的思维链(CoT)推理。然而,此类推理对排序任务的有效性仍未得到充分探索。在本工作中,我们首次系统地研究了重排序中的推理,涵盖逐点(pointwise)和列表式(listwise)两种设置,以及监督微调和强化学习两种训练方式。利用多样化的基准,包括推理密集型数据集(BRIGHT)和标准 IR 基准(BEIR),我们发现,推理增强的重排序器始终逊于直接预测排序而不使用 CoT 的对应模型,尽管其推理成本显著更高。我们的分析揭示了三个核心局限:(i) 在逐点重排序器中,推理破坏了校准并使模型偏向正类,提高了 TPR 但降低了 TNR,从而在负样本占主导的候选池中增加了假阳性并降低了排序质量;(ii) 在列表式重排序器中,推理改善了域内拟合但增加了方差,且无法泛化到域外,即使强化学习缩短了推理过程也是如此;(iii) 总体而言,直接微调的重排序器仍然更加稳定、有效且鲁棒。这些发现挑战了显式推理对重排序普遍有益的假设。最后,我们指出了未来的研究方向,包括面向逐点重排序器的校准感知评分,以及设计简洁且有针对性的推理策略以缓解列表式重排序器中的过拟合与过度思考问题。

关键词

引用

@article{arxiv.2510.08985,
  title  = {Rethinking Reasoning in Document Ranking: Why Chain-of-Thought Falls Short},
  author = {Xuan Lu and Haohang Huang and Rui Meng and Yaohui Jin and Wenjun Zeng and Xiaoyu Shen},
  journal= {arXiv preprint arXiv:2510.08985},
  year   = {2025}
}