中文

编排 LLM 智能体用于科学研究:多选题生成与评估的 pilot 研究

计算机与社会 2026-02-24 v1 人工智能 人机交互

摘要

大型语言模型 (LLM) 的快速进步正在深刻改变科学工作,但关于这些系统如何重塑研究活动的实证证据仍有限。我们报告了一项混合方法的 pilot 评估,评估了一种由人类研究人员协调的基于 LLM 的智能体工作流程,用于数据提取、语料库构建、制品生成和制品评估。在以多选题 (multiple-choice questions, MCQs) 的生成与评估为测试平台,我们收集了 1,071 份 SAT 数学 MCQs,并使用 LLM 智能体从 PDF 中提取问题、检索并转换开放教科书为结构化表示,将每个 MCQs 与相关教科书内容对齐,在指定难度和认知水平下生成新的 MCQs,并使用 24 项质量框架评估原始和生成的 MCQs。在所有评估中,平均 MCQs 质量较高。然而,基于准则级别的分析和等效性检验表明,生成的 MCQs 与专家审核的基线问题并不完全可比。从未实现严格的相似性 (24/24 项准则完全等效)。持续的差距集中在技能深度、认知参与、难度校准和元数据对齐方面,而表层质量,如 {grammar fluency}、{clarity options}、{no duplicates},则始终很强。除了 MCQs 结果外,本研究还记录了一种劳动转变。研究人员的工作从 "authoring items" 转向 {specification, orchestration, verification},以及 {governance}。形式化约束、设计评分标准、构建验证循环、恢复工具故障、审计来源构成主要活动。我们讨论了对科学工作未来影响,包括即将到来的 "AI 研究运营" 技能,这些技能是 AI 赋能研究管道所必需的。

关键词

引用

@article{arxiv.2602.18891,
  title  = {Orchestrating LLM Agents for Scientific Research: A Pilot Study of Multiple Choice Question (MCQ) Generation and Evaluation},
  author = {Yuan An},
  journal= {arXiv preprint arXiv:2602.18891},
  year   = {2026}
}