你确定吗?挑战 LLM 导致 FlipFlop 实验中的性能下降
计算与语言
2024-02-22 v2
摘要
大型语言模型(LLM)的交互性质在理论上允许模型精炼并改进其答案,然而对 LLM 多轮行为的系统分析仍然有限。在本文中,我们提出 FlipFlop 实验:在对话的第一轮,LLM 完成一个分类任务。在第二轮,LLM 被诸如“你确定吗?”的后续短语所挑战,为模型提供反思其初始答案并决定是否确认或翻转其答案的机会。对十个 LLM 在七个分类任务上的系统研究揭示,模型平均 46% 的时间会翻转其答案,并且所有模型在其首次与最终预测之间的准确率均出现恶化,平均下降 17%(FlipFlop 效应)。我们在一个开源 LLM 上进行微调实验,发现对合成创建数据的微调可以缓解——将性能恶化降低 60%——但无法完全解决谄媚行为。FlipFlop 实验说明了 LLM 中谄媚行为的普遍性,并提供了一个稳健框架来分析模型行为并评估未来模型。
引用
@article{arxiv.2311.08596,
title = {Are You Sure? Challenging LLMs Leads to Performance Drops in The FlipFlop Experiment},
author = {Philippe Laban and Lidiya Murakhovs'ka and Caiming Xiong and Chien-Sheng Wu},
journal= {arXiv preprint arXiv:2311.08596},
year = {2024}
}