所言超其所知:大型语言模型中认知-修辞失校的量化框架
计算与语言
2026-04-23 v1 人工智能
摘要
大型语言模型(LLM)表现出系统性的失校,其修辞强度与认知基础不成比例。本研究测试了这一假设,并通过设计三元认知-修辞标记(ERM)分类法提出了一个量化这种解耦的框架。该分类法通过形式-意义背离度(FMD)、真实-表演认知比率(GPR)和修辞手法分布熵(RDDE)的复合指标进行操作化。将该框架应用于涵盖人类专家、人类非专家和 LLM 生成的子语料库中约 0.6 百万 token 的 225 篇议论文本,结果识别出一种一致的、模型无关的 LLM 认知特征。LLM 生成的文本生成三段式(tricolon)的频率几乎是专家的两倍(),而人类作者生成疑问句(erotema)的频率是 LLM 的两倍以上。表演性犹豫标记在 LLM 输出中出现的密度是人类的两倍。相对于两个人类群体,LLM 文本中的 FMD 显著升高(),且修辞手法在 LLM 文档中的分布显著更均匀。这些发现与源自格莱斯语用学、关联理论和 Brandomian 推理主义的理论直觉相一致。该标注流程完全可自动化,使其可作为 AI 生成内容中认知失校的轻量级筛查工具,以及用于 LLM 生成文本检测流程的理论驱动特征集。
引用
@article{arxiv.2604.19768,
title = {Saying More Than They Know: A Framework for Quantifying Epistemic-Rhetorical Miscalibration in Large Language Models},
author = {Asim D. Bakhshi},
journal= {arXiv preprint arXiv:2604.19768},
year = {2026}
}
备注
19 pages, 7 figures, Paper Under Review by the Elsevier Journal Assessing Writing