中文

诊断语言模型中的道德推理习得:语用学与泛化

计算与语言 2025-10-09 v5

摘要

确保大型语言模型(LLM)返回符合社会价值观的公正响应对于其更广泛的应用至关重要。先前研究表明,LLM在需要道德认知的任务(如基于伦理的判断)上往往表现不佳。虽然当前方法侧重于使用精选数据集对LLM进行微调以提高其在此类任务上的能力,但选择最佳学习范式以增强LLM的伦理响应仍是一个开放的研究争论。在这项工作中,我们旨在解决这个基本问题:当前的学习范式能否使LLM获得足够的道德推理能力?借鉴分布语义学理论和道德话语的语用本质,我们的分析表明,性能提升遵循与语义级任务类似的机制,因此仍然受到话语中潜在道德的语用性质的影响,我们将这种现象称为语用困境。我们得出结论,这种语用困境对当前学习范式的泛化能力施加了显著限制,使其成为LLM道德推理习得的主要瓶颈。

关键词

引用

@article{arxiv.2502.16600,
  title  = {Diagnosing Moral Reasoning Acquisition in Language Models: Pragmatics and Generalization},
  author = {Guangliang Liu and Zimo Qi and Xitong Zhang and Lei Jiang and Kristen Marie Johnson},
  journal= {arXiv preprint arXiv:2502.16600},
  year   = {2025}
}