大型语言模型常常言行不一
计算与语言
2025-03-11 v1
摘要
随着大型语言模型 (LLMs) 日益成为各类应用的核心并与多样化的用户群体交互,确保其可靠和一致的性能正变得越来越重要。本文探讨了评估 LLMs 可靠性时的一个关键问题:其言行之间的一致性。为了定量探讨这种一致性,我们开发了一个新颖的评估基准,称为言行一致性测试 (WDCT)。该基准在不同领域(包括观点与行动、非伦理价值与行动、伦理价值与行动、理论与应用)的基于言语的问题和基于行动的问题之间建立了严格的对应关系。评估结果揭示了不同 LLMs 和领域中普遍存在的言行不一致现象。随后,我们进行了仅对言语或仅对行动进行对齐的实验,以观察它们对另一侧的影响。实验结果表明,仅对言语或行动进行对齐对另一侧的影响微弱且不可预测。这支持了我们的假设,即指导 LLMs 言语或行动选择的底层知识并不包含在一个统一的空间内。
引用
@article{arxiv.2503.07003,
title = {Large Language Models Often Say One Thing and Do Another},
author = {Ruoxi Xu and Hongyu Lin and Xianpei Han and Jia Zheng and Weixiang Zhou and Le Sun and Yingfei Sun},
journal= {arXiv preprint arXiv:2503.07003},
year = {2025}
}
备注
Published on ICLR 2025