MAIN:指令调优中必需的相互对齐
计算与语言
2025-12-19 v3
摘要
指令调优使大型语言模型(LLM)实现了显著的性能提升,但其成功严重依赖于大规模高质量指令-响应配对的 availability。为满足这一需求,已develop出 various方法来大规模合成数据。然而,当前扩大数据生成的方法往往忽视了一个关键方面:指令与响应之间的对齐。我们假设,指令-响应对的质量不由每个组件的 individual quality决定,而由相互对齐的程度决定。为此,我们提出了一种相互对齐框架(MAIN),通过相互约束在指令和响应之间强制一致性。我们展示了MAIN在不同模型架构和规模上都能很好地泛化,在LLaMA、Mistral和Qwen模型上达到 state-of-the-art性能。本工作凸显了指令-响应对齐在实现LLM通用且高质量指令调优中的关键作用。所有代码均可从我们的 repository获取。
引用
@article{arxiv.2504.12913,
title = {MAIN: Mutual Alignment Is Necessary for instruction tuning},
author = {Fanyi Yang and Jianfeng Liu and Xin Zhang and Haoyu Liu and Xixin Cao and Yuefeng Zhan and Hao Sun and Weiwei Deng and Feng Sun and Qi Zhang},
journal= {arXiv preprint arXiv:2504.12913},
year = {2025}
}
备注
Accepted by EMNLP 2025