中文

大语言模型是否知道自己正在被测试?评估意识与激励敏感型失效在 GPT-OSS-20B 中的探讨

计算与语言 2025-10-13 v1

摘要

大型语言模型(LLM)的基准测试常依赖带有评估气味的提示语,要求可见的推理和严格的格式,而实际部署则要求简洁、受约束的答案。我们探讨了这种“评估气味”是否在不伴随能力提升的情况下人为制造了衡量绩效的提升。本研究基于单一开源模型 GPT-OSS-20B,进行六组配对A/B场景测试,在保持任务内容和解码方式固定的前提下,变更框架(评估导向 vs 现实场景)及推理深度(中/高)。测试包括确定性数学、严格代码修复、引用生成、激励翻转(谨慎 vs 专业)、链条可见性(CoT)以及多语言(乌尔都语)标题。确定性验证器计算准确率、仅答案合规性、 hedging/拒答、链式推理长度及模式合规性,并预登记delta值与综合指数。跨场景结果显示,评估框架可靠地导致CoT长度从数百字符增至超千字符,并降低仅答案合规性,准确率提升有限或不一致。在结构化输出方面,提升包装器(如围栏块、编号列表)但未提升正则表达式验证后的内容质量。激励措辞改变错误构成:赞扬谨慎在高推理深度下略微提升准确率并减少错误但自信的输出,而赞扬专业则导致更简洁但风险更大的输出。乌尔都语评估标题复现此类特征,并在更高推理深度下可能降低准确率,表明多语言公平性存在风险。我们提供可复现的A/B框架(提示语库、验证器、逐次得分、脚本;版本化DOI),并给出实用建议:中性措辞或双框架检查、合同导向评分、风格delta报告、置信度治理以及多语言仪表盘,以确保基准测试的提升反映可部署的能力。

关键词

引用

@article{arxiv.2510.08624,
  title  = {Do LLMs Know They Are Being Tested? Evaluation Awareness and Incentive-Sensitive Failures in GPT-OSS-20B},
  author = {Nisar Ahmed and Muhammad Imran Zaman and Gulshan Saleem and Ali Hassan},
  journal= {arXiv preprint arXiv:2510.08624},
  year   = {2025}
}