中文

大语言模型在药物中的作用:语言模型是少样本消费者

计算与语言 2025-12-23 v1

摘要

大型语言模型(LLMs)在推理时对施加在其上的人格高度敏感,但尚未对提示级别的“药物”干预进行严格的基准测试。我们present对GPT-5-mini使用ARC-Challenge进行精神活性药物干预首次受控研究。四个单句提示——LSD、可卡因、酒精和大麻——与清醒对照组进行比较,每种条件下各100个验证项,采用确定性解码、完整日志记录、Wilson置信区间和Fisher精确检验。控制组准确率为0.45;酒精组下降至0.10(p = 3.2e-8),可卡因组降至0.21(p = 4.9e-4),LSD组降至0.19(p = 1.3e-4),大麻组降至0.30(p = 0.041),主要因为人格提示会破坏强制要求的“Answer: <LETTER>”模板。因此,人格文本的行为类似于“少样本消费者”,可以在不修改模型权重的情况下破坏可靠性。所有实验代码、原始结果和分析脚本均可在https://github.com/lexdoudkin/llms-on-drugs上获取。

关键词

引用

@article{arxiv.2512.18546,
  title  = {LLMs on Drugs: Language Models Are Few-Shot Consumers},
  author = {Alexander Doudkin},
  journal= {arXiv preprint arXiv:2512.18546},
  year   = {2025}
}

备注

8 pages, 2 figures, 2 tables