DUET:通过来自未见评估任务的反馈优化训练数据混合
机器学习
2026-05-15 v3 人工智能
机器学习
摘要
大语言模型的性能很大程度上取决于其训练数据与下游评估任务的相关性。然而,在实际情况下,涉及未见评估任务的数据往往是未知的(例如,用户与大语言模型之间的对话是端到端加密的)。因此,尚不清楚哪些数据对于通过微调大语言模型以最大化其在特定未见评估任务上的性能是相关的。相反,只能在未见任务上部署大语言模型来收集关于模型表现的多轮反馈(例如,用户评级)。这种新颖的设置为通过来自未见评估任务的反馈优化训练数据混合提供了 refreshing 的视角,而先前的数据混合和选择工作则不考虑这一点。我们的论文提出了 DUET,一种新的全局到本地算法,将影响函数作为数据选择方法与贝叶斯优化交织,以通过来自特定未见评估任务的反馈优化数据混合。通过分析 DUET 的累积后悔,我们理论上展示了 DUET 即使在没有对任务数据知识的情况下,也会收敛到针对未见任务的最优训练数据混合。最终,我们在各种语言任务上的实验表明,DUET 在未见任务设置下超过了现有的数据选择和混合方法。
引用
@article{arxiv.2502.00270,
title = {DUET: Optimizing Training Data Mixtures via Feedback from Unseen Evaluation Tasks},
author = {Zhiliang Chen and Gregory Kang Ruey Lau and Chuan-Sheng Foo and Bryan Kian Hsiang Low},
journal= {arXiv preprint arXiv:2502.00270},
year = {2026}
}
备注
Accepted to ICLR 2026 main conference