中文

当LLM不被告知该思考什么时,它们会想什么?

人工智能 2026-02-03 v1 机器学习

摘要

刻画大型语言模型(LLMs)在多样化情境下的行为,对可靠监控与AI安全至关重要。然而,大多数现有分析依赖于特定主题或任务的提示,显著限制了可观测范围。本文研究LLM从最小且主题中性输入中生成的内容,探究其近乎无约束的生成行为。尽管缺乏明确主题,模型输出仍覆盖广泛语义空间,令人惊讶的是,每一模型家族均表现出强烈且系统性的主题偏好。GPT-OSS主要生成编程内容(27.1%)与数学内容(24.6%),而Llama最常生成文学内容(9.1%)。DeepSeek常生成宗教内容,Qwen频繁生成多选题。除主题偏好外,我们还观察到内容专业化与深度差异:GPT-OSS常生成更技术化的内容(如动态规划),而其他模型多为基础Python代码。进一步发现,近乎无约束的生成常导致重复短语,揭示了每一模型家族独有的行为特征。例如,Llama的退化输出包含指向个人Facebook与Instagram账户的多个URL。我们公开了来自16个LLM的256,000个样本完整数据集,以及可复现的代码库。

关键词

引用

@article{arxiv.2602.01689,
  title  = {What LLMs Think When You Don't Tell Them What to Think About?},
  author = {Yongchan Kwon and James Zou},
  journal= {arXiv preprint arXiv:2602.01689},
  year   = {2026}
}

备注

NA