ReSURE:用于多轮对话微调的正规化监督不可靠性
计算与语言
2025-08-28 v1
摘要
多轮对话系统的微调需要高质量的监督数据,但常因低质量数据导致性能下降。监督错误在早期轮次中可能在后续轮次中传播,破坏连贯性和响应质量。现有方法通常通过静态预过滤来处理数据质量,这将质量控制与训练分离,无法缓解轮次级误差传播。在此背景下,我们提出 ReSURE(Regularizing Supervision UnREliability),一种自适应学习方法,动态降低不可靠监督的权重而无需显式过滤。ReSURE 使用 Welford 在线统计方法估计每个轮次的损失分布,并据此动态重新加权样本损失。在单来源和混合质量数据集上进行的实验显示,其稳定性和响应质量均得到提升。值得注意的是,ReSURE 在多个基准测试中显示出正相关的 Spearman 相关系数(0.21 ~ 1.0),这潜在地为有效利用大规模数据铺平了道路。代码已公开于 https://github.com/Elvin-Yiming-Du/ReSURE_Multi_Turn_Training。
引用
@article{arxiv.2508.19996,
title = {ReSURE: Regularizing Supervision Unreliability for Multi-turn Dialogue Fine-tuning},
author = {Yiming Du and Yifan Xiang and Bin Liang and Dahua Lin and Kam-Fai Wong and Fei Tan},
journal= {arXiv preprint arXiv:2508.19996},
year = {2025}
}