揭示大语言模型中的细粒度价值与意见
计算与语言
2025-09-01 v3 计算机与社会
机器学习
摘要
发现大语言模型 (LLM) 中潜在的价值与意见有助于识别偏见并减轻潜在风险。近期方法通过对 LLM 施以包含道德和政治敏感陈述的调查问题,并量化其输出中对这些陈述的立场。然而,LLM 生成的立场会因提示方式而产生巨大差异,且存在多种论点支持或反对特定立场的可能性。本文提出通过分析 156k 条由 6 个大语言模型使用 420 种提示变体生成的 62 个政治 compass test (PCT) 命题的响应来解决此问题。我们对其生成的立场进行粗粒度分析,并对这些立场的纯文本论证进行细粒度分析。对于细粒度分析,我们提出识别响应中的典型表达 (trope):即在不同提示下反复且一致出现的语义相似短语,揭示 LLM 倾向于产生的文本模式。我们发现,添加到提示中的人口统计学特征对 PCT 测试结果具有显著影响,反映出偏见,以及在引导封闭形式响应与开放域响应时测试结果之间的差异。此外,典型表达在纯文本论证中显示出即使在立场差异显著的情况下,相似的论证也在不同模型和提示下被重复生成。
引用
@article{arxiv.2406.19238,
title = {Revealing Fine-Grained Values and Opinions in Large Language Models},
author = {Dustin Wright and Arnav Arora and Nadav Borenstein and Srishti Yadav and Serge Belongie and Isabelle Augenstein},
journal= {arXiv preprint arXiv:2406.19238},
year = {2025}
}
备注
Findings of EMNLP 2024; 28 pages, 20 figures, 7 tables