向内扩张,而非向上扩张?用 GPT-5 测试厚引用上下文分析与脆弱提示
计算与语言
2026-02-27 v1 人工智能
摘要
本文测试大型语言模型(LLM)是否能够通过在单个硬案例的厚、文本导向阅读中进行规模化,以支持解释性引用上下文分析(CCA)。我们将提示敏感性分析作为方法论问题,通过在平衡 2x3 设计中变化提示框架和掬引。使用 Chubin 和 Moitra (1975) 中第 6 脚注与 Gilbert (1977) 的重构作为探针,我实现一个两阶段 GPT-5 管道:首先进行仅引用文本的表面分类与期望传递,然后使用引用与被引用的完整文本进行跨文档解释性重构。在 90 项重构中,该模型产生 450 个独特假设。通过细读与归纳编码识别出 21 种常见的解释性动作,线性概率模型估计提示选择如何改变这些频率与词汇库。GPT-5 的表面通过高度稳定,始终将引用分类为"补充”。在重构中,该模型生成一组结构化的合理替代方案,但框架与示例会重新分配注意力与词汇,有时偏向牵强的阅读。相对于 Gilbert,GPT-5 检测到相同的文本支点,但更常将其解释为血统与定位,而非谴责。该研究概述了使用 LLM 作为受指引共分析师进行可检验、可争议解释性 CCA 的机会与风险,表明提示框架和掬引系统性地影响模型突出哪些合理阅读与词汇。
引用
@article{arxiv.2602.22359,
title = {Scaling In, Not Up? Testing Thick Citation Context Analysis with GPT-5 and Fragile Prompts},
author = {Arno Simons},
journal= {arXiv preprint arXiv:2602.22359},
year = {2026}
}
备注
26 pages, 1 figure, 3 tables (plus 17 pages supplement including 1 figure)