大语言模型在面板增强语音识别中的表面形式脆弱性
计算与语言
2025-10-13 v1
摘要
大语言模型(LLM)的基准分数可能因记忆测试题目或近似重复项而被高估。我们提出了一种简单方法论,通过对基准问题的改写版本进行重新评估来探测模型的泛化能力。我们使用 Mistral-7B-Instruct 和 Qwen2.5-7B-Instruct,在 ARC-Easy 和 ARC-Challenge 上测量原始题目与改写题目之间的准确率差距。我们的管道控制解码过程,强制执行多选输出格式,并包含健壮的改写清洗步骤以保持语义一致性。我们发现改写导致准确率出现非平凡下降(原始 vs. 改写),这与对数据污染和表面形式捷径的既有担忧相符。
引用
@article{arxiv.2510.08616,
title = {LLMs Show Surface-Form Brittleness Under Paraphrase Stress Tests},
author = {Juan Miguel Navarro Carranza},
journal= {arXiv preprint arXiv:2510.08616},
year = {2025}
}
备注
NeurIPS 2025 Workshop. Evaluating the Evolving LLM Lifecycle: Benchmarks, Emergent Abilities, and Scaling. Selected for contributed talk