通过微调和强化学习提升 LLM 处理推理密集型多媒体搜索能力
信息检索
2025-05-27 v1
摘要
现有的大型语言模型 (LLM) 驱动的搜索代理通常依赖提示工程将用户查询解构为搜索计划,限制了其在需要推理的复杂场景中的效果。此外,这些模型因基于 Python 的搜索计划表示以及对多媒体元素的输入处理和响应生成集成不足而导致令牌消耗过度。为此,我们提出了 SearchExpert,这是一种用于改进 LLM 在复杂搜索查询下的多媒体搜索能力的训练方法。首先,我们将搜索计划重新表述为高效的自然语言表示,以减少令牌消耗。然后,我们提出了用于搜索的监督微调 (SFTS),以适应这些表示进行微调,同时构建了一个自动化的数据集构建管道。接着,我们提出了从搜索反馈中进行的强化学习 (RLSF),将 LLM 计划的搜索结果作为奖励信号。随后,我们提出了一种多媒体理解与生成代理,使微调后的 LLM 能够在推理过程中处理视觉输入并生成视觉输出。最后,我们建立了一个自动化的基准构建管道和人类评估框架。我们的结果基准 SearchExpertBench-25 包含 200 个涵盖金融和国际新闻场景的多选问题,这些问题需要对搜索进行推理。实验表明,SearchExpert 在现有的 FinSearchBench-24 基准上比商业 LLM 搜索方法 (Perplexity Pro) 提升了 36.60%,在我们提出的 SearchExpertBench-25 上提升了 54.54%。人类评估进一步确认了其可读性优势。
引用
@article{arxiv.2505.18831,
title = {Enhancing LLMs' Reasoning-Intensive Multimedia Search Capabilities through Fine-Tuning and Reinforcement Learning},
author = {Jinzheng Li and Sibo Ju and Yanzhou Su and Hongguang Li and Yiqing Shen},
journal= {arXiv preprint arXiv:2505.18831},
year = {2025}
}