批判何时能改进 AI 辅助理论物理?SCALAR:用于智能体推理的结构化批判者-行动者循环
人工智能
2026-05-11 v1 人机交互
高能物理 - 唯象学
高能物理 - 理论
摘要
随着大型语言模型 (LLM) 在研究级物理推理任务上展现出越来越大的潜力,且智能体 AI 变得日益普遍,一个实际问题浮现:研究者与智能体之间的交互如何影响结果?我们使用 SCALAR (Structured Critic--Actor Loop for AI Reasoning,用于 AI 推理的结构化批判者-行动者循环) 来研究这一问题,这是一个应用于量子场论与弦论问题的行动者-批判者-裁判 (Actor--Critic--Judge) 流水线。行动者提出解决方案,批判者提供迭代反馈,独立的裁判根据参考解评估记录文本。我们改变了行动者角色、批判者反馈策略以及行动者模型家族与规模。多轮对话始终优于单次尝试,但改进机制与不同提示选择的价值强烈依赖于行动者-批判者配对。在同一模型家族内增加规模(例如从 8B 参数的 DeepSeek-R1 变体到 DeepSeek-R1 70B)改善了部分较易问题的表现,但并未消除我们观察到的最困难瓶颈。批判者反馈策略在非对称的行动者-批判者设置(例如,由更强的 Sonnet 批判者指导的轻量级 Haiku 行动者)中影响最为明显,其中建设性反馈改善了平均得分结果。在同家族的行动者-批判者设置中,策略效应较弱:有时倾向于宽容反馈,而严格与对抗性反馈并无益处。总而言之,SCALAR 提供了一个受控的测试平台,用于评估哪些交互结构有助于或阻碍 AI 驱动的科学发现。
引用
@article{arxiv.2605.06772,
title = {When Does Critique Improve AI-Assisted Theoretical Physics? SCALAR: Structured Critic--Actor Loop for Agentic Reasoning},
author = {Vasilis Niarchos and Constantinos Papageorgakis and Alexander G. Stapleton and Sokratis Trifinopoulos},
journal= {arXiv preprint arXiv:2605.06772},
year = {2026}
}
备注
17 pages; 9 figures