LLM 和人类是否找到相同的问题困难?以日本语测验为例
计算与语言
2025-11-18 v1
摘要
LLM 在许多 NLP 任务中已超过人类表现,但人类和 LLM 所感知的难度是否相同仍不清楚。本研究探讨了在 buzzer 环境下,LLM 和人类解答日本语测验的难度差异。具体而言,我们首先收集日本语测验数据,包括问题、答案以及人类正确响应率;随后在多种设置下让 LLM 作答,并将其正确率与人类进行比较,从两个分析视角进行比较。实验结果表明,与人类相比,LLM 在正确答案未覆盖 Wikipedia 条目时的测验更困难,也在需要数值答案的问题上表现较差。
关键词
引用
@article{arxiv.2511.12300,
title = {Do LLMs and Humans Find the Same Questions Difficult? A Case Study on Japanese Quiz Answering},
author = {Naoya Sugiura and Kosuke Yamada and Yasuhiro Ogawa and Katsuhiko Toyama and Ryohei Sasano},
journal= {arXiv preprint arXiv:2511.12300},
year = {2025}
}