中文

CommunityBench:面向多样化群体与任务的社区级对齐基准测试

计算与语言 2026-01-21 v1

摘要

大型语言模型 (LLM) 对齐确保模型行为反映人类价值观。现有的对齐策略主要遵循两条路径:一条假设存在统一目标的全局价值集(即“一刀切”),另一条则将每个个体视为独特对象以定制模型(即个体级)。然而,假设单一的价值空间会边缘化少数群体的规范,而为个体定制模型又成本高昂。认识到人类社会组织成具有高群内价值一致性的社会集群,我们提出将社区级对齐作为一种“中间立场”。在实践中,我们引入了 CommunityBench,这是首个用于评估社区级对齐的大规模基准测试,其包含基于共同身份与共同纽带理论的四项任务。借助 CommunityBench,我们对各种基础模型进行了全面评估,结果显示当前 LLM 在建模社区特定偏好方面的能力有限。此外,我们探讨了社区级对齐在促进个体建模方面的潜力,为可扩展的多元化对齐提供了有前景的方向。

关键词

引用

@article{arxiv.2601.13669,
  title  = {CommunityBench: Benchmarking Community-Level Alignment across Diverse Groups and Tasks},
  author = {Jiayu Lin and Zhongyu Wei},
  journal= {arXiv preprint arXiv:2601.13669},
  year   = {2026}
}