中文

前沿大语言模型如何适应神经发展障碍背景:表面变化 vs 结构性变化的系统化评估框架

计算与语言 2026-05-04 v1 人工智能 人机交互

摘要

我们检验前沿聊天式大语言模型(LLMs)是否根据神经发展障碍(ND)背景在系统提示中调整其输出,并描述这些调整的性质。具体而言,我们提出了 NDBench,这是一个包含 576 个输出的基准测试,涉及两款前沿模型、三种系统提示类型(基线、ND 个人档案断言,以及带有明确调整指令的 ND 个人档案断言)、四种典型 ND 案例,以及跨四个类别的 24 个提示,其中一个类别采用对抗式掩码策略。我们的发现揭示了四个持续出现的趋势:第一,LLMs 在 ND 背景下表现出显著的适应性,其中完全指示的条件会产生更详尽、更结构化的输出,表现为更高的 token 数、更多的标题以及更细化的步骤(p < 10^-8,Holm 校正);第二,此类适应主要是结构性的:尽管列表密度变化不大,但标题出现频率和每步细节数均显著上升;第三,仅靠 ND 个人档案断言无法抑制潜在有害倾向,因为掩码-强化现象的降低仅在明确指示的情况下才会显著(降幅 36-44%);在个人档案断言条件下,降低幅度几乎没有变化。此外,对 LLM 基于损害评估的可靠性分析显示,仅有两项六个维度(掩码和强化、验证质量)超过预定义的 judges 间一致性阈值(alpha >= 0.67),因此可视为主要结果。NDBench 及其提示、输出、代码和其他资源均公开提供,形成一个可复现的框架,用于审计未来 LLMs 对 ND 意识的适应性。

关键词

引用

@article{arxiv.2605.00113,
  title  = {How Frontier LLMs Adapt to Neurodivergence Context: A Measurement Framework for Surface vs. Structural Change in System-Prompted Responses},
  author = {Ishan Gupta and Pavlo Buryi},
  journal= {arXiv preprint arXiv:2605.00113},
  year   = {2026}
}

备注

15 pages, 3 figures, 2 tables. Benchmark, code, and data available at https://github.com/ishansgupta/ndbench