ChatGPT 的行为如何随时间变化?
计算与语言
2023-11-01 v3 人工智能
机器学习
摘要
GPT-3.5 与 GPT-4 是两种使用最广泛的大语言模型(LLM)服务。然而,这些模型随时间更新何时及如何发生是不透明的。在此,我们在多个不同任务上评估了 2023 年 3 月与 2023 年 6 月版本的 GPT-3.5 和 GPT-4:1)数学问题,2)敏感/危险问题,3)意见调查,4)多跳知识密集型问题,5)代码生成,6)美国医师执照考试,以及 7)视觉推理。我们发现 GPT-3.5 与 GPT-4 的性能和行为均可能随时间大幅变化。例如,GPT-4(2023 年 3 月)在辨别素数与合数上尚合理(准确率 84%),但 GPT-4(2023 年 6 月)在这些相同问题上表现糟糕(准确率 51%)。这部分可由 GPT-4 遵循思维链提示的意愿下降解释。有趣的是,GPT-3.5 在此任务上 6 月远优于 3 月。GPT-4 在 6 月比 3 月更不愿回答敏感问题与意见调查问题。GPT-4 在 6 月的多跳问题上表现优于 3 月,而 GPT-3.5 在此任务上性能下降。GPT-4 与 GPT-3.5 在 6 月的代码生成中均比 3 月有更多格式错误。我们提供证据表明 GPT-4 遵循用户指令的能力随时间下降,这是诸多行为漂移背后的一个共同因素。总体而言,我们的发现表明“同一”LLM 服务的行为可在相对短时间内发生显著变化,凸显了对 LLMs 持续监测的必要性。
引用
@article{arxiv.2307.09009,
title = {How is ChatGPT's behavior changing over time?},
author = {Lingjiao Chen and Matei Zaharia and James Zou},
journal= {arXiv preprint arXiv:2307.09009},
year = {2023}
}
备注
add more evaluations on instruction following