中文

CoHyDE:LLM改写器与稠密编码器的迭代协训练用于工具检索

人工智能 2026-05-29 v1 信息检索 机器学习

摘要

大型API目录上的工具检索是LLM代理的核心瓶颈:用户查询以口语化且常不完整的语言形式呈现,而目录使用技术API词汇,任何固定编码器都无法独自桥接这种差距。两种主流训练方法——对比度编码器微调和基于冻结LLM的HyDE式查询扩展——分别从不同的方向解决此问题,却在互补的方向上失败:微调后的编码器在查询表面形式已匹配目录时表现出色,但在不匹配时会崩溃;而零shot HyDE对不完整查询更稳健,但生成的假设描述缺乏对目录的认知,反而在查询已完善时会降低检索效果。我们引入CoHyDE,一种迭代 procedures 训练稠密编码器和LLM改写器作为单一协同演化系统:编码器基于改写器生成的目录风格假设描述进行InfoNCE训练,改写器通过DPO对齐编码器的检索得分,两者在工具目录上进行warm start后开始循环。在约1万个工具子集的ToolBench目录上,CoHyDE经过三轮训练,相较于最强的单组件基线在标准查询上提升2.5个百分点NDCG@5,在 held-out 模糊查询上提升6.3个百分点,最难的模糊层级上提升最高达8个百分点。消融实验确认协训练是关键要素:仅使用其中一个组件都无法匹配CoHyDE在标准查询和模糊查询上的表现,对模糊查询的最高损失可达-8个百分点。

关键词

引用

@article{arxiv.2605.29271,
  title  = {CoHyDE: Iterative Co-Training of LLM Rewriter & Dense Encoder for Tool Retrieval},
  author = {Vaishali Senthil and Ashutosh Hathidara and Sebastian Schreiber},
  journal= {arXiv preprint arXiv:2605.29271},
  year   = {2026}
}