反例博弈:语言模型中的迭代概念分析与修复
计算与语言
2026-05-06 v1 人工智能
摘要
概念分析——提出定义并通过反例对其进行完善——是哲学方法论的核心。我们研究语言模型能否通过迭代分析与修复链来执行此任务:一个模型实例针对提出的定义生成反例,另一个模型修复该定义,该过程不断重复。在 20 个概念和数千次反例-修复周期中,我们发现,尽管许多 LM 生成的反例被人类专家和 LM 裁判判定为无效,但 LM 裁判接受的反例数量大约是人类接受的两倍。尽管如此,逐项有效性判断在人类之间以及人类与 LM 之间具有中等程度的一致性。我们进一步发现,延长迭代会产生越来越冗长的定义,但并未提高准确性。我们还观察到,某些概念总体上难以具有稳定的定义。这些发现表明,尽管 LM 能够参与哲学推理,但反例-修复循环很快就会达到边际收益递减,并且可以作为评估 LM 能否维持高水平迭代哲学推理的有效测试用例。
引用
@article{arxiv.2605.03936,
title = {The Counterexample Game: Iterated Conceptual Analysis and Repair in Language Models},
author = {Daniel Drucker and Kyle Mahowald},
journal= {arXiv preprint arXiv:2605.03936},
year = {2026}
}