大型语言模型的对齐性与可驾驭性差:来自大学生招生作文的证据
计算与语言
2026-01-23 v2
摘要
人们越来越多地使用配备大型语言模型(LLM)的技术来撰写正式通信文本,这在技术与社会的交叉点上提出了两个重要问题:LLM 写作的对象(模型对齐);以及 LLM 是否可以被提示来改变其写作对象(模型可驾驶性)。我们在选择性大学的本科生招生这一高风险情境下,通过比较由 30,000 名申请人撰写的作文与两种 LLM 生成的作文之间的词汇和句子变异情况进行研究:一种仅使用人类申请人所使用的作文问题进行提示;另一种则包含每个申请人的额外人口统计学信息。我们一致发现,无论是哪种类型的 LLM 生成作文,都与人类撰写的作文在语言上存在显著差异, regardless of specific model 和分析方法。进一步地,对特定的社会人口统计身份进行提示在对齐模型以匹配该身份群体中人类写作模式方面效果极不理想。这一现象在性别、种族、第一代学生身份以及地理位置等关键维度上都成立。经人口统计学提示和未提示的合成文本之间也比与人类文本更相似,这意味着提示并未缓解同质化问题。这些当前 LLM 的模型对齐和可驾驶性问题引发了关于在高风险情境中使用 LLM 的担忧。
引用
@article{arxiv.2503.20062,
title = {Poor Alignment and Steerability of Large Language Models: Evidence from College Admission Essays},
author = {Jinsook Lee and AJ Alvero and Thorsten Joachims and René Kizilcec},
journal= {arXiv preprint arXiv:2503.20062},
year = {2026}
}
备注
48 pages, 10 figures, 6 tables