数据安排时机决定一切:指令调优中的零样本泛化
计算与语言
2025-04-08 v2 人工智能
机器学习
摘要
理解对齐技术始于理解指令调优所带来的零样本泛化,但鲜有人真正洞悉其机制。现有工作主要局限于任务层面,未考虑任务是人工定义的,对大语言模型而言仅由标记和表示构成。为弥合这一差距,我们从数据本身的角度来探讨零样本泛化。我们首先表明,零样本泛化在指令调优过程中极早阶段便会发生,损失值可作为稳定的指标。随后,我们从相似性和粒度两个角度考察训练数据的安排,确认某些训练样例的暴露时机可能显著促进对未见任务的泛化。最后,我们提出一种更为严谨的训练数据安排框架——Test-centric Multi-turn Arrangement,证明其在促进持续学习和进一步降低损失方面的有效性。首次我们展示,指令调优中的零样本泛化是训练数据与测试数据在实例层面之间基于相似性的泛化形式。我们的代码已公开于 https://github.com/thunlp/Dynamics-of-Zero-Shot-Generalization。
引用
@article{arxiv.2406.11721,
title = {The Right Time Matters: Data Arrangement Affects Zero-Shot Generalization in Instruction Tuning},
author = {Bingxiang He and Ning Ding and Cheng Qian and Jia Deng and Ganqu Cui and Lifan Yuan and Haiwen Hong and Huan-ang Gao and Longtao Huang and Hui Xue and Huimin Chen and Zhiyuan Liu and Maosong Sun},
journal= {arXiv preprint arXiv:2406.11721},
year = {2025}
}
备注
22 pages, 16 figures