中文

当 LLM 遇到狡猾文本:面向大型语言模型的谬误理解基准

计算与语言 2024-06-11 v2

摘要

最近,大型语言模型(LLM)在语言理解和生成方面取得了显著进展。随之而来,衡量 LLM 各种能力的各种基准测试如雨后春笋般涌现。在本文中,我们通过提出一个包含狡猾文本的谬误理解基准(FLUB)来挑战 LLM 的推理和理解能力,这些文本对人类来说易于理解,但对模型来说却难以掌握。具体而言,FLUB 关注的狡猾文本主要由从真实互联网环境中收集的陷阱、幽默和误导性文本组成。我们在 FLUB 基准中设计了三个难度递增的任务,以评估 LLM 的谬误理解能力。基于 FLUB,我们研究了多个具有代表性和先进的 LLM 的表现,反映出我们的 FLUB 具有挑战性且值得在未来进行更多研究。在我们广泛的实验和详细的分析中,获得了有趣的发现和有价值的见解。我们希望我们的基准能够鼓励社区提高 LLM 理解谬误的能力。我们的数据和代码可在 https://github.com/THUKElab/FLUB 获取。

关键词

引用

@article{arxiv.2402.11100,
  title  = {When LLMs Meet Cunning Texts: A Fallacy Understanding Benchmark for Large Language Models},
  author = {Yinghui Li and Qingyu Zhou and Yuanzhen Luo and Shirong Ma and Yangning Li and Hai-Tao Zheng and Xuming Hu and Philip S. Yu},
  journal= {arXiv preprint arXiv:2402.11100},
  year   = {2024}
}