意识到差距:LLM 对亚洲公共舆论的对齐之陷阱
计算与语言
2026-03-24 v2 计算机与社会
摘要
大型语言模型(LLM)正在多语言、多文化环境中部署,但其依赖以英语为主的训练数据可能导致与不同社会多样化文化价值观不一致。在本文中,我们对当代LLM(包括GPT-4o-Mini、Gemini-2.5-Flash、Llama 3.2、Mistral和Gemma 3)在印度、东亚和东南亚的文化对齐进行全面而多语言的审计。我们的研究特别聚焦于宗教作为更广泛对齐的窗口。为便于此,我们对每个LLM的内部表示进行多层次分析,使用log-prob/logits来比较模型的意见分布与真实公共意见。我们发现尽管这些热门模型在广泛社会议题上通常与公众意见一致,但在宗教观点上总是未能准确代表,尤其是少数群体,常常放大消极刻板印象。轻量干预,如人口统计学 priming和本國语言 prompting,部分缓解但未消除这些文化差距。我们进一步表明,下游评估在偏见基准测试(如CrowS-Pairs、IndiBias、ThaiCLI、KoBBQ)中揭示了持续的伤害和欠代表性。我们的发现凸显了系统性、区域性 grounding 审计的紧迫需求,以确保LLM在全球范围内的公平部署。
引用
@article{arxiv.2603.06264,
title = {Mind the Gap: Pitfalls of LLM Alignment with Asian Public Opinion},
author = {Hari Shankar and Vedanta S P and Sriharini Margapuri and Debjani Mazumder and Ponnurangam Kumaraguru and Abhijnan Chakraborty},
journal= {arXiv preprint arXiv:2603.06264},
year = {2026}
}
备注
13 pages, including AAAI Paper Checklist. Accepted in Proceedings of the 20th International AAAI Conference on Web and Social Media (ICWSM 2026)