中文

面向多轮对话指令微调的数据选择

计算与语言 2026-04-21 v3 人工智能

摘要

经过指令微调的语言模型越来越依赖大规模的多轮对话语料库,但这些数据集通常包含噪声且结构不一致,存在主题漂移、重复闲聊以及跨轮次答案格式不匹配等问题。我们从数据选择的角度解决这个问题,并提出了MDS(多轮对话选择),这是一个对话级别的框架,用于对整个对话而非孤立轮次进行评分。MDS结合了一个全局覆盖阶段,该阶段在用户查询轨迹空间中进行分箱选择,以保留具有代表性且不冗余的对话;以及一个局部结构阶段,该阶段通过基于实体的主题锚定和信息进展来评估对话内的可靠性,并结合查询-答案形式一致性以实现功能对齐。MDS在三个多轮基准测试和一个领域内银行测试集上,优于强大的单轮选择器、对话级LLM评分器以及启发式基线,在无参考和基于参考的指标上取得了最佳整体排名,并且在相同的训练预算下,对长对话具有更强的鲁棒性。代码和资源包含在补充材料中。

关键词

引用

@article{arxiv.2604.07892,
  title  = {Data Selection for Multi-turn Dialogue Instruction Tuning},
  author = {Bo Li and Shikun Zhang and Wei Ye},
  journal= {arXiv preprint arXiv:2604.07892},
  year   = {2026}
}

备注

Github: https://github.com/WisdomShell/MDS Project: https://wisdomshell.github.io/MDS/