评估提示方法对 ChatGPT 数学能力的影响
人工智能
2024-02-21 v2 计算与语言
机器学习
摘要
本研究批判性地评估了提示方法在增强大型语言模型(LLM)数学推理能力方面的有效性。该研究使用了三种规范性提示方法——简单提示、角色提示和对话提示——已知这些方法在增强 LLM 的语言任务方面是有效的。我们在 OpenAI 的 LLM 聊天机器人 ChatGPT-3.5 上,针对来自 MATH、GSM8K 和 MMLU 数据集的大量问题集进行了分析,涵盖了广泛的数学挑战。我们使用针对每个数据集改编的评分脚本来确定这些提示干预在增强模型数学分析能力方面的有效性。与预期相反,我们的实证分析表明,所研究的方法均未能持续提升 ChatGPT-3.5 的基线性能,某些方法甚至导致了显著的性能下降。我们的研究结果表明,提示策略并不一定能推广到新领域,在本研究中未能提升数学性能。
引用
@article{arxiv.2312.15006,
title = {Assessing the Impact of Prompting Methods on ChatGPT's Mathematical Capabilities},
author = {Yuhao Chen and Chloe Wong and Hanwen Yang and Juan Aguenza and Sai Bhujangari and Benthan Vu and Xun Lei and Amisha Prasad and Manny Fluss and Eric Phuong and Minghao Liu and Raja Kumar and Vanshika Vats and James Davis},
journal= {arXiv preprint arXiv:2312.15006},
year = {2024}
}