LINGOLY-TOO: 通过模板化正字法混淆解耦推理与知识
计算与语言
2026-05-12 v7 人工智能
摘要
前沿语言模型在解决推理问题方面表现出日益增强的能力,但它们的表现往往通过绕过推理、转而依赖其不断扩展的知识和记忆能力而被夸大。我们引入了LINGOLY-TOO,一个包含1203个问题和共计6995个子问题的具有挑战性的推理基准,通过将专家设计的混淆应用于语言学奥林匹克问题来抵消这些捷径。这些混淆保留了底层的解决逻辑,同时降低了问题可通过知识或记忆来解决的可能性。我们的实验表明,模型在原始问题上利用捷径,而混淆后性能显著下降。即使是最好的推理模型也仍然高度敏感,分数从原始问题的约0.59降至混淆后的0.48。LINGOLY-TOO将推理与知识解耦,提供了对真实推理能力的更清晰衡量。
引用
@article{arxiv.2503.02972,
title = {LINGOLY-TOO: Disentangling Reasoning from Knowledge with Templatised Orthographic Obfuscation},
author = {Jude Khouja and Lingyi Yang and Karolina Korgul and Simeon Hellsten and Vlad A. Neacsu and Harry Mayne and Ryan Othniel Kearns and Andrew M. Bean and Adam Mahdi},
journal= {arXiv preprint arXiv:2503.02972},
year = {2026}
}
备注
Published as a conference paper at ICLR 2026