评估语言模型在文本场景中的关机规避行为
计算与语言
2023-07-04 v1 人工智能
摘要
近来,对大语言模型涌现性与危险性能力进行评估的兴趣有所增加。重要的是,智能体可能推理出在某些场景中若不被关闭则能更好地实现其目标,这会导致不良行为。在本文中,我们研究了使用玩具文本场景来评估诸如 GPT-4 和 Claude 等语言模型中的工具性推理与关机规避的潜力。此外,我们探究关机规避是否仅仅是数据集与提示之间简单模式匹配的结果,还是跨不同环境与变体的一致行为。我们手动评估了行为,并试验了使用语言模型进行自动评估,这些评估表明简单模式匹配可能并非关机规避的唯一促成因素。本研究为语言模型在关机规避场景中的行为提供了见解,并启发了关于使用文本场景进行评估的进一步研究。
引用
@article{arxiv.2307.00787,
title = {Evaluating Shutdown Avoidance of Language Models in Textual Scenarios},
author = {Teun van der Weij and Simon Lermen and Leon lang},
journal= {arXiv preprint arXiv:2307.00787},
year = {2023}
}