中文

MathChat:多轮交互中数学推理与指令遵循的基准测试

人工智能 2024-05-31 v1

摘要

大型语言模型 (LLM) 在单轮问答格式中展现出惊人的数学问题解决能力,但现实场景中常涉及需要多轮或交互式信息交换的数学问答,LLM 在此类任务上的表现仍未得到充分探索。本文引入 MathChat,一个专为评估 LLM 在更广泛数学任务范围内的性能而设计的综合基准测试。这些任务结构化设计,用于评估模型在多轮交互和开放式生成方面的能力。我们评估了 various SOTA LLM 在 MathChat 基准测试上的性能,发现这些模型在单轮问答方面表现出色,但在需要持续推理和对话理解的复杂场景中显著表现不足。为解决现有 LLM 在多轮和开放式任务中的局限性,我们开发了 MathChat sync,一套基于合成对话的数据集,用于 LLM 微调,专注于提高模型在对话中交互和指令遵循能力。实验结果强调,像 MathChat sync 这样多样化、对话式指令调优数据集的训练对于提升 LLM 多轮数学推理能力至关重要。我们认为本工作为改进 LLM 的多轮数学推理能力指明了一条有前景的方向,从而推动了更擅长交互式数学问题解决和实际应用的 LLM 发展。

关键词

引用

@article{arxiv.2405.19444,
  title  = {MathChat: Benchmarking Mathematical Reasoning and Instruction Following in Multi-Turn Interactions},
  author = {Zhenwen Liang and Dian Yu and Wenhao Yu and Wenlin Yao and Zhihan Zhang and Xiangliang Zhang and Dong Yu},
  journal= {arXiv preprint arXiv:2405.19444},
  year   = {2024}
}