ZEBRA:利用模型行为知识构建零标注偏好数据集
人工智能
2025-06-03 v3 计算与语言
摘要
LLM 对齐的最新工作聚焦于通过人类或人工智能(AI)标注者构建大规模偏好数据集。然而,这种方法依赖于逐实例的监督,导致巨大的标注成本和可解释性有限。在本文中,我们提出了 ZEBRA——一种基于模型行为的零标注框架,通过利用来自基准性能的模型行为知识来构建偏好数据。ZEBRA 通过评估响应对来源模型的质量和相似性,将响应对二元化,从而完全绕过实例级标注。这使得对齐数据生成具有可扩展性、可控性和高性价比。实证结果表明,尽管 ZEBRA 无需手动或基于模型的标记,却实现了与实例监督方法相当的对齐性能。
引用
@article{arxiv.2502.18744,
title = {ZEBRA: Leveraging Model-Behavioral Knowledge for Zero-Annotation Preference Dataset Construction},
author = {Jeesu Jung and Chanjun Park and Sangkeun Jung},
journal= {arXiv preprint arXiv:2502.18744},
year = {2025}
}
备注
16 pages,7 figures,5 tables,4 graphs