中文

TheoremExplainAgent:面向 LLM theorem understanding 的视频式多模态解释

人工智能 2025-05-27 v2 计算与语言 计算机视觉与模式识别 多媒体

摘要

理解领域特定的定理往往需要超过文本推理,结构化的可视化解释对于深层理解至关重要。虽然大型语言模型(LLM)在文本-based 定理推理中表现出色,但其生成连贯且具有教育意义的可视化解释能力仍是开放挑战。本文引入TheoremExplainAgent,一种用于生成超过 5 分钟的定理解释视频(使用 Manim 动画)的智能体方法。为系统评估多模态定理解释,我们提出TheoremExplainBench,覆盖 240 个跨多个 STEM 学科的定理,以及 5 个自动评估指标。我们的结果表明,智能体式规划对于生成详细的长篇视频至关重要,o3-mini 智能体达成 93.8% 的成功率,整体得分达 0.77。然而,我们的定量与定性研究表明,大多数生成的视频在视觉元素布局方面存在细微问题。此外,多模态解释暴露出文本-based 解释难以察觉的更深层推理缺陷,凸显了多模态解释的重要性。

关键词

引用

@article{arxiv.2502.19400,
  title  = {TheoremExplainAgent: Towards Video-based Multimodal Explanations for LLM Theorem Understanding},
  author = {Max Ku and Thomas Chong and Jonathan Leung and Krish Shah and Alvin Yu and Wenhu Chen},
  journal= {arXiv preprint arXiv:2502.19400},
  year   = {2025}
}

备注

accepted to ACL 2025 main, camera ready