中文

理论 grounding 的评估暴露了 LLM 个人化中的作者差距

计算与语言 2026-04-30 v1

摘要

风格化个人化——使 LLM 编写特定个体风格的文本,而仅仅适应任务偏好——缺乏基于作者科学的评估。我们表明,将评估 grounding 在作者鉴别理论中能够改变基准测试能测量的内容。我们借助三种测量传统——一个经过训练的作者鉴别模型 LUAR;一个解耦特征匹配的 LLM 评判器;以及经典功能词风格学——对四种推理时间个人化方法进行评估,涵盖 50 位作者和 1000 次生成。理论 grounding 的指标 LUAR 提供了即插即用的基准线,人类上限为 0.756,跨作者下限为 0.626,赋予分数以绝对意义。所有方法的得分均低于该下限,范围为 0.484 到 0.508,暴露了对未经 calibration 的指标不可见的作者差距。三种指标之间的成对相关系数接近于零,绝对 r 值小于 0.07,表明在缺乏理论 grounding 的情况下,指标选择决定结论:一个 LLM 评判器宣称明显胜出,而 LUAR 找到没有有意义的区分。这一发现表明理论-基准循环的实际运作:作者理论揭示了未经 grounding 的基准测试所忽视的评估失效。

关键词

引用

@article{arxiv.2604.26460,
  title  = {Theory-Grounded Evaluation Exposes the Authorship Gap in LLM Personalization},
  author = {Yash Ganpat Sawant},
  journal= {arXiv preprint arXiv:2604.26460},
  year   = {2026}
}

备注

6 pages, 2 figures, 2 tables