CYCLE-INSTRUCT:基于双自训练与循环一致性的全无种子指令调优
计算与语言
2025-08-25 v1 人工智能
机器学习
摘要
指令调优对于将大型语言模型(LLM)对齐人类意图至关重要,但当前方法通常依赖昂贵的人工标注种子数据或强大的外部教师模型。虽然指令回译技术降低了这种依赖,但仍根本上依赖于初始种子集合,限制了完全自动化,引入偏见,并可能导致对无标签语料库的低效利用。在本文中,我们提出了 Cycle-Instruct—a 一种实现完全无种子指令调优的新框架。灵感来源于循环一致性,Cycle-Instruct 采用双重自训练循环,其中两种模型(答案生成器和问题生成器)仅从原始无标签文本中引导启动。这些模型通过从对方生成的伪标签中重建原始文本片段来相互监督,从而在没有任何人工提供的种子的情况下从数据内在结构中学习。我们在四个多样化的数据轨道上展示了 Cycle-Instruct 的有效性,包括通用指令跟随、特定领域任务、对话日志和纯文本。我们的大量实验表明,Cycle-Instruct 不仅优于基于种子驱动的回译基线方法,还达到了与强监督方法相当的性能。
引用
@article{arxiv.2508.16100,
title = {CYCLE-INSTRUCT: Fully Seed-Free Instruction Tuning via Dual Self-Training and Cycle Consistency},
author = {Zhanming Shen and Hao Chen and Yulei Tang and Shaolin Zhu and Wentao Ye and Xiaomeng Hu and Haobo Wang and Gang Chen and Junbo Zhao},
journal= {arXiv preprint arXiv:2508.16100},
year = {2025}
}
备注
EMNLP 2025 Main