中文

概念反转Winograd模式挑战:通过抽象评估和改进大语言模型的鲁棒推理

计算与语言 2024-10-17 v1 人工智能

摘要

尽管大语言模型(LLMs)在推理方面展现了惊人的能力,但仍担心因语义关联和表面逻辑链导致幻觉和不可靠推理问题。为评估LLMs是否执行稳健推理而非依赖表面逻辑链,我们提出了新的评估数据集——概念反转Winograd模式挑战(CR-WSC),基于著名的Winograd模式挑战(WSC)数据集。通过简单反转与错误答案更相关的概念,我们发现尽管推理理由不变,LLMs的性能显著下降。此外,我们提出了抽象思维法(Abstraction-of-Thought, AoT),这是一种新颖的提示方法,通过概念抽象恢复对抗性案例到正常案例,以提高LLMs在推理中的鲁棒性和一致性,CR-WSC上的实验结果表明其有效。

关键词

引用

@article{arxiv.2410.12040,
  title  = {Concept-Reversed Winograd Schema Challenge: Evaluating and Improving Robust Reasoning in Large Language Models via Abstraction},
  author = {Kaiqiao Han and Tianqing Fang and Zhaowei Wang and Yangqiu Song and Mark Steedman},
  journal= {arXiv preprint arXiv:2410.12040},
  year   = {2024}
}