中文

PhysicsSolutionAgent:面向数值物理问题求解的多模态解释

计算与语言 2026-01-21 v1 人机交互

摘要

解释数值物理问题通常不仅需要基于文本的解答;清晰的视觉推理可以显著提高概念理解。虽然大型语言模型(LLM)在许多文本形式的物理问题上表现出色,但它们生成冗长且高质量视觉解释的能力仍未得到充分探索。在这项工作中,我们引入了PhysicsSolutionAgent (PSA),这是一个自主智能体,能够使用Manim动画生成长达六分钟的物理问题解释视频。为了评估生成的视频,我们设计了一个评估流水线,该流水线对15个定量参数执行自动检查,并结合来自视觉-语言模型(VLM)的反馈以迭代地提高视频质量。我们在跨越数值和理论物理问题的32个视频上对PSA进行了评估。我们的结果揭示了视频质量方面的系统性差异,这些差异取决于问题难度以及任务是数值的还是理论的。使用GPT-5-mini,PSA实现了100%的视频完成率,平均自动化得分为3.8/5。然而,定性分析和人工检查发现了次要和主要问题,包括视觉布局不一致以及在反馈过程中视觉内容被解释的方式存在错误。这些发现揭示了可靠的Manim代码生成方面的关键局限性,并突显了数值物理问题视觉解释在多模态推理与评估方面的更广泛挑战。我们的工作强调了未来多模态教育系统中需要改进的视觉理解、验证和评估框架。

关键词

引用

@article{arxiv.2601.13453,
  title  = {PhysicsSolutionAgent: Towards Multimodal Explanations for Numerical Physics Problem Solving},
  author = {Aditya Thole and Anmol Agrawal and Arnav Ramamoorthy and Dhruv Kumar},
  journal= {arXiv preprint arXiv:2601.13453},
  year   = {2026}
}