中文

宝藏寻宝:基于训练时间标记的实时长尾目标

计算与语言 2025-06-18 v1 机器学习

摘要

现代机器学习最深刻的挑战之一是如何在稀有和欠代表征的特征上表现良好。大型通用模型在训练许多任务时表现最佳,但在高频用例上效果最佳。训练后,很难使模型在训练语料库中欠代表征的特定用例上表现良好。依赖提示工程或少量样本来最大化特定测试案例的输出质量可能令人沮丧,因为模型对小变化敏感,行为难以预测,或依赖固定的系统提示来维持性能。本文询问:"我们能否优化我们的训练协议,以在推理时提高对欠代表征用例的可控性和性能?"我们重新审视训练和推理技术之间的界限,以提高长尾性能,同时为用户提供一组模型训练来响应的控制杆。我们创建了数据特征和任务来源的详细分类,以显式控制生成属性并在推理时隐式条件化生成。我们对基础模型进行微调,以自动推断这些标记,这使它们在推理时成为可选。这种原则性和灵活的方法在长尾训练分布的示例上实现显著的性能提升。虽然我们在开放式生成质量上平均提升了5.7个胜率,但在欠代表征领域看到超过9.1%的提升。在CodeRepair等欠代表征任务上实现最高14.1%的相对提升,在长度指令跟随评估中实现绝对提升35.3%。

关键词

引用

@article{arxiv.2506.14702,
  title  = {Treasure Hunt: Real-time Targeting of the Long Tail using Training-Time Markers},
  author = {Daniel D'souza and Julia Kreutzer and Adrien Morisot and Ahmet Üstün and Sara Hooker},
  journal= {arXiv preprint arXiv:2506.14702},
  year   = {2025}
}