中文

评估与提升用于 LLM 对齐的奖励模型的文化意识

计算与语言 2025-10-27 v2 人工智能

摘要

奖励模型对于使大语言模型与多元文化对齐至关重要。因此,评估奖励模型的文化意识对于进一步推进 LLM 的全球对齐不可或缺。然而,由于缺乏具有文化相关性的评估数据集,现有的奖励模型评估在评估文化意识方面存在不足。为了填补这一空白,我们提出了文化意识奖励建模基准,涵盖 4 个文化领域的 10 种不同文化。我们对最先进的奖励模型进行了广泛评估,揭示了其在建模文化意识方面的缺陷,并证明了在 CARB 上的表现与下游多语言文化对齐任务之间的正相关性。进一步分析识别了文化感知奖励建模中的虚假相关性,即奖励模型的评分主要依赖于表面特征,而非对真实文化细微差别的理解。为了解决这些问题,我们提出了 Think-as-Locals 方法,通过可验证奖励的强化学习从生成式奖励模型中引导出更深层次的文化根基推理,并采用精心设计的奖励以确保准确的偏好判断和高质量的结构化评估标准生成。实验结果验证了其在缓解虚假特征干扰和推进文化感知奖励建模方面的有效性。

关键词

引用

@article{arxiv.2509.21798,
  title  = {Evaluating and Improving Cultural Awareness of Reward Models for LLM Alignment},
  author = {Hongbin Zhang and Kehai Chen and Xuefeng Bai and Yang Xiang and Min Zhang},
  journal= {arXiv preprint arXiv:2509.21798},
  year   = {2025}
}

备注

Under review;Work in progress;