如果它很好,不要停在一次:我们应该尝试迭代式语料库修整
人工智能
2026-02-04 v2 计算机与社会
计算机科学与博弈论
摘要
最近的研究表明,从预训练数据中过滤有害内容可提升模型安全性而不损害能力。我们提出了一个自然的延伸:再做一次。在过滤后的数据上训练的模型可以进一步过滤语料库;在该更干净的语料库上进行训练会产生更干净的模型。我们提供的理论分析表明,这一过程收敛于自我一致的语料库,即在该语料库上训练的模型会批准其自身的训练数据。即便在 filter quality 保持恒定的弱假设下,迭代也可导致有害内容的减少。我们认为,这一框架提供了一种新的可扩展监督形式。虽然模型内部是黑箱,但 resulting 语料库是可被 human 审查的。即便进行单次迭代,也会产生大规模的文档偏好标注,可能对解释性研究具有价值。我们推导出能力-安全性权衡的下界,并概述开放问题。我们呼吁拥有预训练基础设施的研究者实证测试此方法。
引用
@article{arxiv.2501.15280,
title = {If It's Nice, Do It Twice: We Should Try Iterative Corpus Curation},
author = {Robin Young},
journal= {arXiv preprint arXiv:2501.15280},
year = {2026}
}