强制语言模型输出均匀分布
计算与语言
2024-08-09 v2 机器学习
摘要
尽管当今指令微调后的语言模型专为跟随用户指令而训练,但在被要求生成随机输出时仍表现不佳。例如,在要求从 1 到 10 的范围内均匀选取一个数字时,Llama-2-13B-chat 偏好选择数字 5;在被要求随机挑选一个名字时,Mistral-7B-Instruct 会选择 Avery 的频率是基于美国人口比例的 40 倍。当这些语言模型用于需要输出多样性的实际任务中,如语言模型辅助的数据集构建时,其无法生成对有效选项的均匀分布成为主要瓶颈。本文提出一种微调方法,以鼓励语言模型输出对有效结果均匀分布的输出。我们引入的方法在各种任务和分布上具有普适性,使大型语言模型能够以极少的人工干预实现用于合成数据集生成。
引用
@article{arxiv.2404.10859,
title = {Forcing Diffuse Distributions out of Language Models},
author = {Yiming Zhang and Avi Schwarzschild and Nicholas Carlini and Zico Kolter and Daphne Ippolito},
journal= {arXiv preprint arXiv:2404.10859},
year = {2024}
}