中文

基于对抗LLM框架的修辞风格度量

计算与语言 2025-12-24 v1 计算机与社会

摘要

AI的兴起加剧了对机器学习论文中"hype"现象的关注,但迄今为止尚无可靠方法独立于实质内容对修辞风格进行量化。由于大胆语言可能源于强大的实证结果,也可能仅源于修辞风格,因此很难区分二者。为消除修辞风格与实质内容,本文引入一种对抗LLM框架:多个LLM修辞人格从相同的实质内容生成对抗写作,LLM裁判通过成对评估进行比较,结果通过巴特菲尔-蒂尔模型进行聚合。将此方法应用于8,485篇ICLR提交论文(样本自2017年至2025年),我们生成了250,000多篇对抗写作,提供了对ML论文修辞风格的大规模量化。我们发现,愿景框架显著预测下游注意力,包括引用和媒体注意力,即使控制了同行评审评估亦然。我们还观察到2023年后修辞力度显著上升,并提供实证证据表明这一上升主要由LLM编写辅助工具的采用所致。本框架的可靠性通过其对人格选择的鲁棒性以及LLM判断与人类注释之间的高相关性得到验证。我们的工作表明,LLM可作为衡量和改进科学评估的工具。

关键词

引用

@article{arxiv.2512.19908,
  title  = {Counterfactual LLM-based Framework for Measuring Rhetorical Style},
  author = {Jingyi Qiu and Hong Chen and Zongyi Li},
  journal= {arXiv preprint arXiv:2512.19908},
  year   = {2025}
}