DELIA:大语言模型中指令适应的多样性增强学习
人工智能
2024-08-21 v1 计算与语言
摘要
尽管指令调谐被广泛用于调整大语言模型(LLMs)的行为,大量的实证证据和研究表明它主要是一个模型适应特定任务格式的过程,而非获取新知识或能力。我们提出这一局限性源于指令调谐期间学习到的有偏特征,这些特征与理想的任务特定特征不同,导致在下游任务中学习到更少的底层语义。然而,理想特征未知且不可计算,这限制了过去的工作依赖先验知识来辅助推理或训练,从而将LLMs的能力限制在开发者的能力范围内,而非数据驱动的可扩展学习。在我们的论文中,通过我们的新型数据合成方法DELIA(指令适应的多样性增强学习),我们利用LLM训练中大量多样化数据的缓冲效应,将指令调谐中的有偏特征转化为理想特征的近似值,无需显式的先验理想特征。实验表明DELIA相比常见的指令调谐和其他基线方法具有更好的性能。它在冰岛语-英语翻译BLEURT分数上(WMT-21数据集,gemma-7b-it)比常见指令调谐高出17.07%-33.41%,并在格式化文本生成(Llama2-7b-chat)上将准确率提高了36.1%。值得注意的是,在我们已知的知识注入方法中,DELIA独特地将新特殊标记的内部表示与其先验语义对齐。
引用
@article{arxiv.2408.10841,
title = {DELIA: Diversity-Enhanced Learning for Instruction Adaptation in Large Language Models},
author = {Yuanhao Zeng and Fei Ren and Xinpeng Zhou and Yihang Wang and Yingxia Shao},
journal= {arXiv preprint arXiv:2408.10841},
year = {2024}
}
备注
8 pages, 5 figures