中文

大型语言模型常常言行不一

计算与语言 2025-03-11 v1

摘要

随着大型语言模型 (LLMs) 日益成为各类应用的核心并与多样化的用户群体交互,确保其可靠和一致的性能正变得越来越重要。本文探讨了评估 LLMs 可靠性时的一个关键问题:其言行之间的一致性。为了定量探讨这种一致性,我们开发了一个新颖的评估基准,称为言行一致性测试 (WDCT)。该基准在不同领域(包括观点与行动、非伦理价值与行动、伦理价值与行动、理论与应用)的基于言语的问题和基于行动的问题之间建立了严格的对应关系。评估结果揭示了不同 LLMs 和领域中普遍存在的言行不一致现象。随后,我们进行了仅对言语或仅对行动进行对齐的实验,以观察它们对另一侧的影响。实验结果表明,仅对言语或行动进行对齐对另一侧的影响微弱且不可预测。这支持了我们的假设,即指导 LLMs 言语或行动选择的底层知识并不包含在一个统一的空间内。

关键词

引用

@article{arxiv.2503.07003,
  title  = {Large Language Models Often Say One Thing and Do Another},
  author = {Ruoxi Xu and Hongyu Lin and Xianpei Han and Jia Zheng and Weixiang Zhou and Le Sun and Yingfei Sun},
  journal= {arXiv preprint arXiv:2503.07003},
  year   = {2025}
}

备注

Published on ICLR 2025