中文

反例博弈:语言模型中的迭代概念分析与修复

计算与语言 2026-05-06 v1 人工智能

摘要

概念分析——提出定义并通过反例对其进行完善——是哲学方法论的核心。我们研究语言模型能否通过迭代分析与修复链来执行此任务:一个模型实例针对提出的定义生成反例,另一个模型修复该定义,该过程不断重复。在 20 个概念和数千次反例-修复周期中,我们发现,尽管许多 LM 生成的反例被人类专家和 LM 裁判判定为无效,但 LM 裁判接受的反例数量大约是人类接受的两倍。尽管如此,逐项有效性判断在人类之间以及人类与 LM 之间具有中等程度的一致性。我们进一步发现,延长迭代会产生越来越冗长的定义,但并未提高准确性。我们还观察到,某些概念总体上难以具有稳定的定义。这些发现表明,尽管 LM 能够参与哲学推理,但反例-修复循环很快就会达到边际收益递减,并且可以作为评估 LM 能否维持高水平迭代哲学推理的有效测试用例。

关键词

引用

@article{arxiv.2605.03936,
  title  = {The Counterexample Game: Iterated Conceptual Analysis and Repair in Language Models},
  author = {Daniel Drucker and Kyle Mahowald},
  journal= {arXiv preprint arXiv:2605.03936},
  year   = {2026}
}