PragWorld:评估 LLM 在最小语言改动和对话动态下的局部世界模型
人工智能
2025-11-18 v1 计算与语言
摘要
现实世界的对话充满了诸如实体指称、指代和暗示等语用元素。成功的自然交流需要理解此类细微差别,往往需要构建编码此类元素并捕捉其动态状态的局部世界模型。然而,语言模型(LM)是否构建或维持鲁棒的隐式表示尚不明了。本文我们评估了语言模型在二人对话中编码和更新其内部世界模型的能力,并测试其在语言改动下的可塑性。为此,我们对来源于流行数据集的对话应用七种最小语言改动,构建两个包含是-否问题的基准。我们评估了广泛的开源和闭源语言模型,发现其在保持鲁棒准确率方面存在困难。我们的分析揭示了语言模型在记忆关键细节(如在语言改动后跟踪实体)方面的困境。随后,我们提出了双视角可解释性框架,识别出有用或有害的Transformer层,并突出显示最受有害层影响的语言改动,通常是由于编码虚假信号或依赖捷径。受此启发,我们提出了两种基于层正则化的微调策略,以抑制有害层的影响。
引用
@article{arxiv.2511.13021,
title = {PragWorld: A Benchmark Evaluating LLMs' Local World Model under Minimal Linguistic Alterations and Conversational Dynamics},
author = {Sachin Vashistha and Aryan Bibhuti and Atharva Naik and Martin Tutek and Somak Aditya},
journal= {arXiv preprint arXiv:2511.13021},
year = {2025}
}
备注
23 pages, 15 tables, 10 figures; AAAI 2026 Conference Main Track (oral)