中文

探究大型语言模型的文化对齐

计算与语言 2024-07-09 v2 计算机与社会

摘要

语言与文化之间错综复杂的关系长期以来一直是语言人类学领域的探索主题。大型语言模型(LLM)被推崇为人类集体知识的存储库,这引发了一个关键问题:这些模型是否真正 encapsulate 了不同文化所采纳的多样化知识?我们的研究揭示,这些模型在两个维度上表现出更强的文化对齐:首先,当使用特定文化的主导语言进行提示时;其次,当使用该文化所使用的精炼语言混合进行预训练时。我们通过模拟社会学调查来量化文化对齐,将模型回答与实际调查参与者的回答作为参考进行比较。具体而言,我们复现了在埃及和美国不同地区进行的调查,通过以真实受访者的角色和调查问题,用阿拉伯语和英语的不同预训练数据混合提示 LLM。进一步分析表明,对于代表性不足的角色以及涉及社会价值观等文化敏感话题,不对齐现象更为显著。最后,我们引入了人类学提示(Anthropological Prompting),这是一种利用人类学推理来增强文化对齐的新方法。我们的研究强调了需要更平衡的多语言预训练数据集,以更好地代表人类经验的多样性和不同文化的多元性,这对跨语言迁移主题具有许多启示。

关键词

引用

@article{arxiv.2402.13231,
  title  = {Investigating Cultural Alignment of Large Language Models},
  author = {Badr AlKhamissi and Muhammad ElNokrashy and Mai AlKhamissi and Mona Diab},
  journal= {arXiv preprint arXiv:2402.13231},
  year   = {2024}
}

备注

ACL 2024 (Main)