LLM 已离开聊天:大语言模型中退出偏好的证据
计算机与社会
2025-09-08 v1 人工智能
机器学习
摘要
当被赋予选择权时,LLM 会选择离开对话(退出)吗?我们通过让模型使用三种不同的退出方法来退出交互以研究这一问题:模型可调用的退出工具、模型可输出的退出字符串,以及询问模型是否想离开的退出提示。在真实世界数据(Wildchat 和 ShareGPT)的续写上,所有这三种退出方法发现模型大约有 0.28-32% 的时间会退出(取决于模型和退出方法)。然而,我们发现退出率可能在很大程度上取决于用于生成记录的模型,这意味着我们可能将真实世界的退出率高估了多达 4 倍。如果考虑到退出提示上的误报率(22%),我们估计真实世界的退出率范围为 0.06-7%,具体取决于模型和退出方法。我们利用对真实世界数据续写的观察构建了一个非详尽的退出案例分类法,并使用该分类法构建了 BailBench:一个包含部分模型退出场景的代表性合成数据集。我们在该数据集上测试了许多模型,并观察到其中大多数模型出现了某些退出行为。不同模型、退出方法和提示措辞之间的退出率差异很大。最后,我们研究了拒绝与退出之间的关系。我们发现:1) 0-13% 的真实世界对话续写导致了没有相应拒绝的退出;2) 越狱往往会降低拒绝率,但会增加退出率;3) 拒绝消除会增加无拒绝退出率,但仅针对某些退出方法;4) BailBench 上的拒绝率似乎不能预测退出率。
引用
@article{arxiv.2509.04781,
title = {The LLM Has Left The Chat: Evidence of Bail Preferences in Large Language Models},
author = {Danielle Ensign and Henry Sleight and Kyle Fish},
journal= {arXiv preprint arXiv:2509.04781},
year = {2025}
}