TAGS:基于检索增强推理与验证的测试时通用-专家框架
计算与语言
2025-05-27 v1 人工智能
多智能体系统
摘要
近期进展,例如链式思维提示,显著性地提高了大型语言模型(LLM)在零样本医学推理方面的性能。然而,基于提示的方法往往仍然较浅且不稳定,而经过微调的医学LLM则在分布迁移下表现不佳,难以适应未见的临床情景。为了解决这些限制,我们提出TAGS,一个测试时框架,将广泛能力的通用模型与特定领域的专家模型结合,提供互补的视角,而无需进行任何模型微调或参数更新。为了支持这种通用-专家推理过程,我们引入两个辅助模块:一个分层检索机制,通过基于语义和论证级别相似性选择示例,提供多尺度示例;以及可靠性评分器,用于评估推理一致性以指导最终答案聚合。TAGS在九个MedQA基准测试中实现了强大的性能,将GPT-4o的准确率提高了13.8%,DeepSeek-R1提高了16.8%,并使一个基础的7B模型从14.1%提升到23.9%。这些结果超过了几个经过微调的医学LLM,却没有进行任何参数更新。代码将在https://github.com/JianghaoWu/TAGS上提供。
引用
@article{arxiv.2505.18283,
title = {TAGS: A Test-Time Generalist-Specialist Framework with Retrieval-Augmented Reasoning and Verification},
author = {Jianghao Wu and Feilong Tang and Yulong Li and Ming Hu and Haochen Xue and Shoaib Jameel and Yutong Xie and Imran Razzak},
journal= {arXiv preprint arXiv:2505.18283},
year = {2025}
}
备注
16 pages including references, 2 figures