中文

利用人类生产-解释不对称性测试LLM认知合理性

计算与语言 2025-06-04 v2

摘要

大型语言模型(LLM)是否以类似人类的方式处理语言,是大量理论和实践讨论的焦点。我们通过考察人类句子处理中所见的生产-解释区分,评估指令调优LLM是否复制这一区分。我们以隐式因果动词中代词生产与解释之间的不对称性这一实证记录的现象为测试基准,发现部分LLM在定量和定性上反映出人类类似的生产-解释不对称。我们展示了这种行为是否成立取决于模型规模——较大的模型更可能呈现人类模式,以及用于激发该行为的元语言提示词的选择。我们的代码和结果已公开于https://github.com/LingMechLab/Production-Interpretation_Asymmetries_ACL2025。

关键词

引用

@article{arxiv.2503.17579,
  title  = {Leveraging Human Production-Interpretation Asymmetries to Test LLM Cognitive Plausibility},
  author = {Suet-Ying Lam and Qingcheng Zeng and Jingyi Wu and Rob Voigt},
  journal= {arXiv preprint arXiv:2503.17579},
  year   = {2025}
}

备注

ACL 2025 Camera-ready