关于语言模型的附屈性声明:缺失的人类在环
计算与语言
2025-12-02 v1 计算机与社会
摘要
关于大型语言模型 (LLM) 附屈性响应模式的论述在文献中日益增长。我们审阅了衡量 LLM 附屈性的方法学挑战,并识别了五个核心操作化形式。尽管附屈性本质上是以人类为中心的,但当前研究不评估人类感知。我们的分析突显了在人工智能对齐相关概念中区分附屈性响应的困难,并为未来研究提供了可操作的建议。
引用
@article{arxiv.2512.00656,
title = {Sycophancy Claims about Language Models: The Missing Human-in-the-Loop},
author = {Jan Batzner and Volker Stocker and Stefan Schmid and Gjergji Kasneci},
journal= {arXiv preprint arXiv:2512.00656},
year = {2025}
}
备注
NeurIPS 2025 Workshop on LLM Evaluation and ICLR 2025 Workshop on Bi-Directional Human-AI Alignment