是生成还是判别?衡量大语言模型文化对齐性的方法论考量
计算与语言
2026-01-07 v1
摘要
社会人口统计引导(SDP)——即使用人口统计代理信息引导大语言模型(LLM)以生成符合文化偏好的输出——常常显示出LLM回复呈现刻板印象和偏见。虽然该方法在评估LLM文化专业能力方面有效,但由于提示敏感性、解码参数以及生成相对于判别任务(由于输出空间更大)的固有难度等混合因素,SDP容易受到混淆因素的影响。这些因素使解释变得复杂,难以确定性能差的原因是偏见还是任务设计。为此,我们采用逆社会人口统计引导(ISDP),即引导LLM判别并预测来自不同用户的实际和模拟用户行为中的人口统计代理信息。我们使用 Goodreads-CSI 数据集(Saha 等,2025),该数据集捕捉了来自印度、墨西哥和美国用户理解英语书评难度的情况,并测试了四个LLM:Aya-23、Gemma-2、GPT-4o 和 LLaMA-3.1。使用 ISDP 的结果显示,模型在处理实际行为时表现优于模拟行为,这与 SDP 的建议相反。然而,无论是哪种行为类型,性能都会下降并在个体层面变得几乎相等,表明个性化存在局限性。
引用
@article{arxiv.2601.02858,
title = {To Generate or Discriminate? Methodological Considerations for Measuring Cultural Alignment in LLMs},
author = {Saurabh Kumar Pandey and Sougata Saha and Monojit Choudhury},
journal= {arXiv preprint arXiv:2601.02858},
year = {2026}
}
备注
IJCNLP-AACL 2025