Suri:面向长文本生成的多约束指令遵循
计算与语言
2024-10-03 v2
摘要
现有研究在指令遵循方面主要关注简单指令和短回复的任务。在本工作中,我们探索了针对生成长文本的多约束指令遵循。我们创建了Suri数据集,包含20K个人类撰写的长文本,配有LLM生成的、包含多个复杂约束的反向翻译指令。由于收集长文本人类偏好判断的挑战巨大,诸如DPO等偏好调优算法在本情境下不可行;因此,我们提出了基于ORPO算法的指令遵循方法I-ORPO。I-ORPO不通过来自不受欢迎回复的负反馈,而是从由LLM生成的合成损坏指令中获取负反馈。使用Suri,我们对Mistral-7b-Instruct-v0.2进行监督学习和I-ORPO微调。 resulting models, Suri-SFT和Suri-I-ORPO,生成的文本长度显著增加(约5K token),而且没有显著的质量下降。我们的human evaluation显示,尽管SFT和I-ORPO模型都满足大多数约束,但Suri-I-ORPO生成的文本在约束的连贯性和信息性方面更受青睐。我们将在https://github.com/chtmp223/suri上发布代码。
引用
@article{arxiv.2406.19371,
title = {Suri: Multi-constraint Instruction Following for Long-form Text Generation},
author = {Chau Minh Pham and Simeng Sun and Mohit Iyyer},
journal= {arXiv preprint arXiv:2406.19371},
year = {2024}
}
备注
Accepted to EMNLP'24 (Findings)