遵循指令中的长度约束
计算与语言
2024-06-26 v1
摘要
经过对齐的指令遵循模型比未对齐的模型能更好地满足用户请求。然而,研究表明此类模型的评估存在长度偏差,且训练算法倾向于利用这种偏差来学习更长的回复。在这项工作中,我们展示了如何训练能够在推理时通过包含期望长度约束的指令进行控制的模型。此类模型在长度指令评估中表现更优,优于 GPT4、Llama 3 和 Mixtral 等标准指令遵循模型。
引用
@article{arxiv.2406.17744,
title = {Following Length Constraints in Instructions},
author = {Weizhe Yuan and Ilia Kulikov and Ping Yu and Kyunghyun Cho and Sainbayar Sukhbaatar and Jason Weston and Jing Xu},
journal= {arXiv preprint arXiv:2406.17744},
year = {2024}
}
备注
13 pages