中文

基于局部大型语言模型的集成辩论用于AI对齐

人工智能 2025-11-18 v2 计算与语言

摘要

随着大型语言模型(LLM)在高风险决策中发挥更大的作用,对人类价值观的对齐至关重要。依赖专有API会限制可重复性和广泛参与。我们研究了本地开源集成辩论是否可以改善对齐导向的推理。在150场辩论(涵盖15种情景和5种集成配置)中,集成方案在7分制评估标准上优于单模型基线(总体得分:3.48 vs. 3.13),在推理深度(+19.4%)和论证质量(+34.1%)方面的提升最大。改进在真实性(+1.25分)和人类增强(+0.80分)方面最为显著。我们提供代码、提示语和辩论数据集,为基于集成的对齐评估提供可访问且可重复的基础。

关键词

引用

@article{arxiv.2509.00091,
  title  = {Ensemble Debates with Local Large Language Models for AI Alignment},
  author = {Ephraiem Sarabamoun},
  journal= {arXiv preprint arXiv:2509.00091},
  year   = {2025}
}

备注

The manuscript is being withdrawn to incorporate additional revisions and improvements