When and How Human Curation Backfires: Preference Alignment under Multi-Model Self-Consuming Loop
人工智能
2026-05-29 v1 机器学习
摘要
基础模型正越来越多地基于先前模型迭代生成的合成数据进行训练,而非仅使用真实数据。这种自消费训练范式可能导致模型崩溃、发散或偏差放大。最近的工作(Ferbach等,2024)表明,将人类策展纳入循环可以将自消费模型引导 toward 人类对齐行为,但这些分析关注单个、孤立的模型,该模型仅消费自身输出。实际上,模型通常会相互交互并训练于其他模型产生的输入输出对。本文研究多模型自消费训练的情形。我们首先形式化了相互作用的自消费模型框架并刻画了 resulting 动力系统收敛到稳定点的条件。我们然后考察了对一个模型的人类策展如何影响其自身对齐(自影响)以及这些效应如何传播到其他模型(交叉影响)。与孤立环境不同,在那里人类策展总是提高模型对齐, 我们表明,跨模型相互作用可以抑制或甚至反转这种效应,最终降低长期对齐。
引用
@article{arxiv.2605.29267,
title = {When and How Human Curation Backfires: Preference Alignment under Multi-Model Self-Consuming Loop},
author = {Yang Zhang and Xiukun Wei and Xueru Zhang},
journal= {arXiv preprint arXiv:2605.29267},
year = {2026}
}