超越训练:数据集语言结构在大语言模型中的文化意识作用
计算与语言
2026-02-03 v1
摘要
大语言模型 (LLM) 的全球部署引发了关于文化错位的担忧,但用于文化适应的微调数据集的语言属性仍鲜有了解。我们从数据集中心的视角审视文化对齐问题,探讨哪些语言属性的微调数据与文化表现相关,是否存在训练前的预测性,以及这些效应如何随模型不同而变化。我们计算了阿拉伯语、中文和日文数据集的轻量级语言、语义和结构指标,并在每个语言内部分别应用主成分分析。该设计确保所得主成分捕获同一语言中数据集间的差异,而非不同语言间的差异。所得主成分对应于与语义连贯性、表层词汇和句法多样性以及词汇或结构丰富性相关的可解释轴向,但其组成在不同语言间存在差异。我们对三大 LLM 系列 (LLaMA、Mistral、DeepSeek) 进行微调,并在文化知识、价值观和规范的基准测试中进行评估。尽管 PCA 主成分与下游性能相关,但这些关联在模型依赖性较强。通过受控子集干预,我们发现词汇导向的主成分 (PC3) 最为稳健,能在不同模型和基准测试中实现更一致的性能,而强调语义或多样性极端值 (PC1-PC2) 往往是中性或有害的。
引用
@article{arxiv.2602.01161,
title = {Beyond Training for Cultural Awareness: The Role of Dataset Linguistic Structure in Large Language Models},
author = {Reem I. Masoud and Chen Feng and Shunta Asano and Saied Alshahrani and Philip Colin Treleaven and Miguel R. D. Rodrigues},
journal= {arXiv preprint arXiv:2602.01161},
year = {2026}
}