中文

密度引导响应优化:基于隐式接受信号的社区导向对齐

人工智能 2026-03-04 v1 计算与语言

摘要

部署在线社区中的语言模型必须适应这些社区在社会、文化和特定领域背景下的差异化规范。先前的对齐方法依赖显式偏好监督或预定义原则,这些方法对资源丰富的设置有效,但排除了大多数没有机构支持、缺乏注释基础设施或围绕敏感话题组织的社区——在这些社区中,偏好寻求成本高昂、伦理棘手或文化上不匹配。我们观察到社区已经通过他们接受的内容、他们与之互动以及他们允许其持续存在的方式来隐式表达偏好。我们表明,这种接受行为在表示空间中诱导可测量的几何结构:被接受的响应占据连贯的高密度区域,反映社区特定的规范,而被拒绝的内容则位于稀疏或不匹配的区域。我们将这种结构作为隐式偏好信号进行操作,引入基于密度引导的响应优化 (DGRO),这是一种无需显式偏好标签即可对齐语言模型到社区规范的方法。使用标记的偏好数据,我们证明了局部密度能够恢复成对的社区判断,表明几何结构编码了有意义的偏好信号。随后,我们在跨越平台、主题和语言的注释稀缺设置中应用 DGRO。DGRO 对齐后的模型在相对于监督和提示基线的语言模型、领域专家和基于模型的评判家那里,都能产生更受偏好的响应。我们将 DGRO 定位为社区在显式偏好监督不可用或与具体实践不匹配时,实际的对齐替代方案,并讨论了从新兴接受行为中学习的潜在影响和风险。

关键词

引用

@article{arxiv.2603.03242,
  title  = {Density-Guided Response Optimization: Community-Grounded Alignment via Implicit Acceptance Signals},
  author = {Patrick Gerard and Svitlana Volkova},
  journal= {arXiv preprint arXiv:2603.03242},
  year   = {2026}
}

备注

27 Pages