中文

通过作者剖析探测大语言模型中的文化信号

计算与语言 2026-03-20 v2 机器学习

摘要

大语言模型(LLMs)在具有社会影响力的应用中日益广泛部署,引发了关于其编码的文化偏见的关注。我们通过评估LLMs在零样本设置下是否能够从歌词中进行作者剖析,推断歌手的性别和族群,以探测这些表征。我们在超过10,000首歌词上评估了多个开源模型,发现LLMs实现了非平凡的剖析性能,但表现出系统性的文化对齐:大多数模型倾向于北美族群,而DeepSeek-1.5B与亚洲族群的对齐更为强烈。这一发现从模型的预测分布和生成理由分析中得出。为量化这些差异,我们引入两个公平性指标,模态准确率偏差(MAD)和召回偏差(RD),并表明Ministral-8B在所评估模型中显示出最强的族群偏见,而Gemma-12B表现出最为平衡的行为。我们的代码已在GitHub上提供,结果可在HuggingFace上获取。

关键词

引用

@article{arxiv.2603.16749,
  title  = {Probing Cultural Signals in Large Language Models through Author Profiling},
  author = {Valentin Lafargue and Ariel Guerra-Adames and Emmanuelle Claeys and Elouan Vuichard and Jean-Michel Loubes},
  journal= {arXiv preprint arXiv:2603.16749},
  year   = {2026}
}