面向多轮对话指令微调的数据选择
计算与语言
2026-04-21 v3 人工智能
摘要
经过指令微调的语言模型越来越依赖大规模的多轮对话语料库,但这些数据集通常包含噪声且结构不一致,存在主题漂移、重复闲聊以及跨轮次答案格式不匹配等问题。我们从数据选择的角度解决这个问题,并提出了MDS(多轮对话选择),这是一个对话级别的框架,用于对整个对话而非孤立轮次进行评分。MDS结合了一个全局覆盖阶段,该阶段在用户查询轨迹空间中进行分箱选择,以保留具有代表性且不冗余的对话;以及一个局部结构阶段,该阶段通过基于实体的主题锚定和信息进展来评估对话内的可靠性,并结合查询-答案形式一致性以实现功能对齐。MDS在三个多轮基准测试和一个领域内银行测试集上,优于强大的单轮选择器、对话级LLM评分器以及启发式基线,在无参考和基于参考的指标上取得了最佳整体排名,并且在相同的训练预算下,对长对话具有更强的鲁棒性。代码和资源包含在补充材料中。
引用
@article{arxiv.2604.07892,
title = {Data Selection for Multi-turn Dialogue Instruction Tuning},
author = {Bo Li and Shikun Zhang and Wei Ye},
journal= {arXiv preprint arXiv:2604.07892},
year = {2026}
}
备注
Github: https://github.com/WisdomShell/MDS Project: https://wisdomshell.github.io/MDS/