LLMSR@XLLM25:Less is More:通过质量引导蒸馏提升结构化多智能体推理
计算与语言
2025-05-14 v2
摘要
LLMSR@XLLM25构成了一个低资源结构化推理任务,挑战LLMs仅凭最少的标注数据生成可解释的、逐步推理 rationale。我们提出Less is More,作为LLMSR@XLLM25第三名获奖方案,专注于仅使用24个标注示例进行结构化推理。我们的方案利用多智能体框架,结合逆向提示归纳、通过GPT-4o进行检索增强推理综合,以及双阶段奖励引导过滤,以在三个子任务中蒸馏高质量监督:问题解析、CoT解析和步骤级验证。所有模块都基于Meta-Llama-3-8B-Instruct在统一的LoRA+ setup下进行微调。通过结合结构验证与奖励过滤,跨越few-shot和zero-shot提示,我们的管道持续改进结构化推理质量。这些结果凸显了在低资源约束下,通过可控数据蒸馏增强结构化推理的价值。我们的代码可在https://github.com/JhCircle/Less-is-More获取。
引用
@article{arxiv.2504.16408,
title = {LLMSR@XLLM25: Less is More: Enhancing Structured Multi-Agent Reasoning via Quality-Guided Distillation},
author = {Jiahao Yuan and Xingzhe Sun and Xing Yu and Jingwen Wang and Dehui Du and Zhiqing Cui and Zixiang Di},
journal= {arXiv preprint arXiv:2504.16408},
year = {2025}
}
备注
XLLM @ ACL 2025 Shared Task-III: LLM for Structural Reasoning (LLM-SR)