LLM 天才悖论:语言与数学专家在简单单词计数问题中的挣扎
计算与语言
2025-02-10 v2 人工智能
摘要
令人惊讶的是,尽管 LLM 在许多任务上表现出色,但在人类觉得 trivial 的简单任务中仍会挣扎,例如计数单词 "strawberry" 中字符 'r' 的数量。关于 LLM 在简单单词计数问题中表现不足的原因,有许多流行的猜测(例如分词、架构和训练数据),这些猜测分享了类似的信念,即这种不足源于模型的预训练,可能在部署时难以避免。在本文中,我们仔细设计了多个评估设置,以检验流行猜测的有效性。同时,我们衡量了专门的 LLM 在数学和编码推理能力从简单计数任务中的可转移性。尽管专门的 LLM 也在计数问题中受限,我们发现关于 LLM 本质性不足的猜测无效,并进一步寻求从 LLM 中获取有益于计数任务的知识和能力的机会。与通过微调和情境学习等常用策略相比,我们表明,积极的推理是帮助 LLM 更准确地感知任务并提供更准确响应的最稳健和高效的方法。我们希望我们的猜测验证设计能为研究 LLM 未来关键失效模式提供见解。基于将先进能力转移到更简单任务的挑战,我们呼吁更多关注模型能力获取与评估。我们还强调在模型预训练期间培育 "在回应前进行推理" 意识的重要性。
引用
@article{arxiv.2410.14166,
title = {LLM The Genius Paradox: A Linguistic and Math Expert's Struggle with Simple Word-based Counting Problems},
author = {Nan Xu and Xuezhe Ma},
journal= {arXiv preprint arXiv:2410.14166},
year = {2025}
}
备注
NAACL 2025