协同对齐:重新思考对齐作为双向人机认知适应
人工智能
2025-11-19 v5 多智能体系统
摘要
当前通过 RLHF 实现的 AI 对齐遵循单向范式,即 AI 顺应人类偏好,同时将人类认知视为固定不变。我们提出向协同对齐转变,采用双向认知对齐(BiCA),其中人类与 AI 相互适应。BiCA 使用可学习的协议、表示映射和 KL 预算约束来实现受控的协同演化。在协作导航任务中,BiCA 相比 70.3% 的基线实现了 85.5% 的成功率,互适性提升 230%,协议收敛性提升 332%。涌现协议的表现比人工设计的协议高出 84%,而双向适应出乎意料地提升了安全性(分布外鲁棒性增加 23%)。46% 的协同提升表明,最佳协作存在于人类与 AI 能力的交集而非并集处,验证了从单向范式向协同对齐范式的转变。
引用
@article{arxiv.2509.12179,
title = {Co-Alignment: Rethinking Alignment as Bidirectional Human-AI Cognitive Adaptation},
author = {Yubo Li and Weiyi Song},
journal= {arXiv preprint arXiv:2509.12179},
year = {2025}
}