用于大语言模型精确计算的自言自语式代码
计算与语言
2023-11-02 v2
摘要
高质量的对话数据集对于利用大语言模型(LLM)后端的智能辅导系统(ITS)的成功开发至关重要。使用先进 GPT-4 模型生成的合成师生对话是创建这些数据集的常用策略。然而,诸如涉及复杂计算的物理等学科带来了挑战。尽管 GPT-4 展现出令人印象深刻的语言处理能力,其在基础数学推理上的局限削弱了它对于这些学科的效用。为应对该局限,我们在本文中引入一种创新的带状态提示设计。我们的设计编排一场模拟对话,其中学生与辅导机器人角色均由 GPT-4 模拟。每个学生回应触发 GPT 辅导机器人内部独白或“代码自言自语”(code soliloquy),评估其后续回应是否需要计算。若判定需要计算,则编写相关 Python 代码并利用 Python 输出构造对学生的回应。我们的方法显著提升了合成对话数据集的质量,尤其对于计算密集的学科。我们初步的学科专家评估显示,我们的 Higgs 模型——一个微调的 LLaMA 模型——有效使用 Python 进行计算,显著增强了 Higgs 回应的准确性与计算可靠性。代码、模型和数据集可在 https://github.com/luffycodes/Tutorbot-Spock-Phys 获取。
引用
@article{arxiv.2309.12161,
title = {Code Soliloquies for Accurate Calculations in Large Language Models},
author = {Shashank Sonkar and MyCo Le and Xinghe Chen and Naiming Liu and Debshila Basu Mallick and Richard G. Baraniuk},
journal= {arXiv preprint arXiv:2309.12161},
year = {2023}
}