MSCoRe:LLM 代理多阶段协作推理基准
计算与语言
2025-09-24 v1 人工智能
摘要
大型语言模型(LLMs)在单一领域的问答任务中表现出色,但其在复杂多阶段情境下的推理与协调能力仍未得到充分探索。现有基准通常聚焦于孤立任务或狭窄领域,忽略了在无需外部指导的情况下实现多阶段协作与优化的能力。为填补这一空白,我们提出 \textbf{MSCoRe},一个新颖的基准,包含 126696 个跨越汽车、制药、电子和能源等领域的领域特定问答实例。该数据集采用结构化的三阶段管道创建:动态抽样、迭代问答生成和多级质量评估,以确保数据质量。任务进一步按阶段覆盖度和复杂度分为三个难度级别。基于 MSCoRe,我们对 various state-of-the-art LLM 代理进行了全面评估。商业模型在所有任务和情境中表现最佳,但简单任务与复杂任务之间仍存在显著的 ROUGE 分数差距。我们还测试了模型的鲁棒性,发现其性能会因噪声数据而受到负面影响。MSCoRe 为社区提供了宝贵的新资源,用于评估和改进 LLM 代理的多阶段推理能力。代码和数据已提供于 https://github.com/D3E0-source/MSCoRE。
引用
@article{arxiv.2509.17628,
title = {MSCoRe: A Benchmark for Multi-Stage Collaborative Reasoning in LLM Agents},
author = {Yuzhen Lei and Hongbin Xie and Jiaxing Zhao and Shuangxue Liu and Xuan Song},
journal= {arXiv preprint arXiv:2509.17628},
year = {2025}
}
备注
10 pages, 5 figures