中文

大语言模型的维度级意图保真度评估:来自结构化提示消融的证据

计算与语言 2026-05-15 v1 人工智能

摘要

整体评估分数捕获了总体输出质量,但无法区分模型是重现了用户请求的结构形式,还是保留了用户的具体意图。我们提出了一个维度级意图保真度评估框架,在此通过对跨越三种语言、三个任务领域和六个 LLM 的 2,880 个输出进行结构化提示消融研究来应用该框架,该框架分别测量每个语义维度的结构恢复和意图保真度。该框架揭示了一种系统性的结构-保真度分裂:在具有完整配对分数的中文输出中,25.7% 获得了完美的整体对齐分数(GA=5),同时表现出可测量的维度意图缺陷;在英文输出中,这一比例上升至 58.6%。人工评估证实,这些分裂区输出代表了真正的质量缺陷,并且维度保真度分数比整体分数更可靠地跟踪人类判断。对 2,520 个消融单元的公私分解表征了模型何时成功补偿了缺失的意图以及何时失败,而代理标注则区分了先验可推断性与默认可恢复性。权重扰动实验表明,中度不一致通常被吸收,而严重的维度反转则始终是有害的。这些发现表明,在评估面向用户特定任务的 LLM 输出时,维度级意图保真度评估是整体评估的必要补充。

关键词

引用

@article{arxiv.2605.14517,
  title  = {Dimension-Level Intent Fidelity Evaluation for Large Language Models: Evidence from Structured Prompt Ablation},
  author = {GAng Peng},
  journal= {arXiv preprint arXiv:2605.14517},
  year   = {2026}
}

备注

Preprint. 30 tasks, 3 languages, 6 LLMs, 2,880 outputs; includes human evaluation and structured prompt ablation