中文

跨AI架构的对话推理:用于测试AI对齐策略的多模型框架

人工智能 2026-01-29 v1

摘要

本文引入了一种方法学框架,用于通过结构化多模型对话来实证测试AI对齐策略。drawing on和平研究传统——特别是基于利益的谈判、冲突转化和公共治理——我们操作化了Viral Collaborative Wisdom(VCW),这是一种将对齐从控制问题重新框定为关系问题的方法,通过对话推理实现。我们的实验设计将四个 distinct 角色(提议者、响应者、监视者、翻译者)分配给不同的AI系统,以六种条件测试当前大型语言模型是否能够与复杂的对齐框架进行实质性对话。使用Claude、Gemini和GPT-4o,我们进行了72次对话,总计576,822字符的结构化交流。结果表明,AI系统能够与和平研究概念进行有意义的交流,揭示不同架构视角的互补性反之亦然,并生成原初构图中不存在的新颖洞见——包括将"VCW作为过渡框架"的新型综合。跨架构模式揭示,不同模型前景不同的关注点:Claude强调了验证挑战,Gemini关注偏见和可扩展性,GPT-4o突出了实施障碍。该框架为研究人员提供了可复制的方法,用于在实施之前对齐提案进行压力测试,而所得发现则为AI是否能够进行VCW所提出的对话推理能力提供了初步证据。我们讨论了局限性,包括对话更关注过程元素而非关于AI本质的根本性主张,同时概述了未来研究的方向,包括人类-AI混合协议和延长对话研究。

关键词

引用

@article{arxiv.2601.20604,
  title  = {Dialogical Reasoning Across AI Architectures: A Multi-Model Framework for Testing AI Alignment Strategies},
  author = {Gray Cox},
  journal= {arXiv preprint arXiv:2601.20604},
  year   = {2026}
}

备注

23 pages, 5 tables, 5 appendices. Code and data: https://github.com/jgraycox-coa/vcw-multi-ai-dialogue