什么使得密码十字括号对大语言模型具有挑战性?
计算与语言
2025-01-15 v2 人工智能
摘要
密码十字括号是一种依赖通用知识以及解题者在不同层面上操控语言能力,涉及各种文字游戏的谜题。先前的研究表明,即使是现代 NLP 模型,包括大语言模型(LLM),在解决此类谜题方面也面临挑战。然而,关于这些模型在此任务上表现不佳的原因几乎没有研究。本文为三种流行的大语言模型(Gemma2、LLaMA3 和 ChatGPT)建立了基准结果,显示其在该任务上的表现仍显著低于人类水平。我们还调查了这些模型为何难以取得优异性能的原因。我们在 https://github.com/bodasadallah/decrypting-crosswords 上发布了代码和引入的数据集。
引用
@article{arxiv.2412.09012,
title = {What Makes Cryptic Crosswords Challenging for LLMs?},
author = {Abdelrahman Sadallah and Daria Kotova and Ekaterina Kochmar},
journal= {arXiv preprint arXiv:2412.09012},
year = {2025}
}
备注
COLING 2025. arXiv admin note: text overlap with arXiv:2403.12094