中文

语言模型能否自我批评?探究 BioASQ 2025 中检索增强生成的自我反馈机制

计算与语言 2025-08-08 v1

摘要

智能体检索增强生成 (RAG) 和“深度研究”系统旨在实现自主搜索过程,其中大语言模型 (LLM) 迭代地优化输出。然而,将这些系统应用于特定领域的专业搜索(例如生物医学研究)存在挑战,因为自动化系统可能会减少用户参与并与专家的信息需求不一致。专业搜索任务通常要求高水平的用户专业知识和透明度。使用专家制定的问题的 BioASQ CLEF 2025 挑战赛可以作为研究这些问题的平台。我们探索了当前推理型和非推理型 LLM(如 Gemini-Flash 2.0、o3-mini、o4-mini 和 DeepSeek-R1)的性能。我们方法的一个关键方面是自我反馈机制,其中 LLM 生成、评估,然后优化其输出,用于查询扩展和多种答案类型(是/否、事实型、列表型、理想型)。我们研究了这种迭代自我修正是否能提高性能,以及推理模型是否更能生成有用的反馈。初步结果表明,自我反馈策略在不同模型和任务上的表现各不相同。这项工作提供了对 LLM 自我修正的见解,并为未来在这些搜索系统中比较 LLM 生成反馈与直接人类专家输入的有效性研究提供了信息。

关键词

引用

@article{arxiv.2508.05366,
  title  = {Can Language Models Critique Themselves? Investigating Self-Feedback for Retrieval Augmented Generation at BioASQ 2025},
  author = {Samy Ateia and Udo Kruschwitz},
  journal= {arXiv preprint arXiv:2508.05366},
  year   = {2025}
}

备注

Version as accepted at the BioASQ Lab at CLEF 2025