中文

稍微意味稍微?衡量 LLM 数值行为中模糊强度词的表现

计算与语言 2026-05-22 v1 人工智能

摘要

当这些词必须产生数值行为时,语言模型是否保留了强度词的序数含义?我研究了一个由研究者构建的 10 个英文程度副词尺度,从 slightly 到 drastically,依据 Quirk 等人的程度副词分类。在一个受控的资源分配环境中,Claude Haiku 接收自然语言指令,产生数值分配,随后由确定性后端将该分配转换为可衡量的结果。唯一改变的变量是强度词或初始系统状态,隔离了这些因素对模型数值输出的影响。在 T=0.0 和 T=0.7 下进行 6620 次实验后,出现了三个模式:首先,模型将 10 个强度词压缩为 5 个不同的中位输出:四个较低阶词映射到相同值,而较强的词在更高的区间中分化(Spearman rho = 0.845, p < 0.001)。其次,当当前系统状态作为上下文提供时,独立的 Kruskal-Wallis 检验显示,按起始分配分组捕获的秩基方差远大于按词分组(epsilon-squared baseline = 0.782 vs. epsilon-squared word = 0.079),且词汇区分在系统趋近容量时退化为零。第三,在接近可行性限制时,模型表现出三种行为模式:弱词小幅调整以 hedge,强词完全放弃,词 drastically 推至局部上限。这些模式在温度上持续存在,随机抽样扩大了分布但未恢复词与词之间的序数区分。在该模型和领域中,模型对模糊强度词的数值解释是压缩的、状态依赖的,并且在操作边界附近呈离散。

关键词

引用

@article{arxiv.2605.21827,
  title  = {Does Slightly Mean Somewhat? Measuring Vague Intensity Words in LLM Numeric Actions},
  author = {Daniel Tabach},
  journal= {arXiv preprint arXiv:2605.21827},
  year   = {2026}
}

备注

9 figures, 2 tables, 16 references