当你不告诉 LLM 该思考什么时,LLM 会想什么?
量子物理
2026-04-08 v2
摘要
刻画大语言模型(LLM)在不同情境下的行为对于可靠监控和 AI 安全至关重要。然而,大多数现有分析依赖于特定主题或任务的提示,这会显著限制可观察的内容。本文我们研究 LLM 从最小化、主题中性输入中生成的内容,探索其近乎无约束的生成行为。尽管缺乏明确主题,模型输出覆盖广泛的语义空间,令人惊讶的是,每一模型家族都表现出强烈且系统性的主题偏好。GPT-OSS 主要生成编程内容(27.1%)和数学内容(24.6%),而 Llama 最频繁生成文学内容(9.1%)。DeepSeek 常生成宗教内容,Qwen 则频繁生成多选题。除了主题偏好,我们还观察到内容专业化和深度存在差异:GPT-OSS 常生成更技术性的内容(如动态规划),而其他模型则生成基础内容(如基本 Python)。此外,我们发现近乎无约束的生成常导致重复短语,揭示了每个模型家族独特的行为。例如,Llama 的退化输出包含指向个人 Facebook 和 Instagram 账户的多个 URL。我们公开了来自 16 个 LLM 的 256,000 份样本的完整数据集,以及可复现的代码库。
引用
@article{arxiv.2602.01688,
title = {Optimal Control to Minimize Dissipation and Fluctuations in Open Quantum Systems Beyond Slow and Rapid Regimes},
author = {Yuki Kurokawa and Yoshihiko Hasegawa},
journal= {arXiv preprint arXiv:2602.01688},
year = {2026}
}