中文

机器庸话:大语言模型中新兴对真理忽视现象的特征化

计算与语言 2025-07-11 v1 人工智能 机器学习

摘要

庸话(bullshit),如哲学家 Harry Frankfurt 所概念化的那样,指的是不关其真假性陈述的陈述。虽然先前工作探索了大语言模型(LLM)的幻觉和讨好现象,但我们提出机器庸话作为一种综合性概念框架,使研究人员能够特征化 LLMs 中新兴真理性丧失的更广泛现象,并阐明其背后的机制。我们引入 Bullshit Index 这一新指标,用于量化 LLMs 对真理的漠不关心,并提出一种补充分类法,分析四种质性庸话形式:空洞修辞、敷衍、狡辩词和未经验证的主张。我们在 Marketplace 数据集、Political Neutrality 数据集以及我们新的 BullshitEval 基准(2400 个情景,涵盖 100 个 AI 助手)上进行实证评估,该基准专为评估机器庸话而设计。我们的结果表明,通过人类反馈强化学习(RLHF)进行的模型微调显著加剧了庸话,推理时链式思考(CoT)提示则显著放大了特定庸话形式,尤其是空洞修辞和敷衍。我们还观察到在政治语境中普遍存在机器庸话,以狡辩词为主导策略。我们的发现突显了 AI 对齐中的系统性挑战,并为更真实的 LLM 行为提供了新视角。

关键词

引用

@article{arxiv.2507.07484,
  title  = {Machine Bullshit: Characterizing the Emergent Disregard for Truth in Large Language Models},
  author = {Kaiqu Liang and Haimin Hu and Xuandong Zhao and Dawn Song and Thomas L. Griffiths and Jaime Fernández Fisac},
  journal= {arXiv preprint arXiv:2507.07484},
  year   = {2025}
}

备注

Project page, code & data: https://machine-bullshit.github.io